Détection d'émotions dans des textes en français — BiLSTM & CamemBERT

Sogeti by Capgemini · 2024

Mission d'IA appliquée (projet Talent Needs Trend) : classification d'émotions dans des phrases en français avec un réseau BiLSTM puis un modèle CamemBERT ajusté, en TensorFlow/Keras et Hugging Face — préparation et nettoyage des données, harmonisation et fusion des labels, entraînement avec early stopping et évaluation.

Mission d'intelligence artificielle appliquée menée chez Sogeti (Capgemini) dans le cadre du projet Talent Needs Trend : détecter automatiquement l'émotion exprimée dans des phrases en français (joie, peur, colère, tristesse, dégoût, surprise, neutre) à partir d'un jeu de données annoté.

Le travail a commencé par la donnée : harmonisation de labels hétérogènes (français/anglais, synonymes), nettoyage du texte, analyse de la distribution des classes et de la longueur des phrases. Une première approche en Keras — embeddings + LSTM bidirectionnel + dropout — a servi de référence, avant de passer à CamemBERT, modèle de langue pré-entraîné pour le français (Hugging Face Transformers), tokenisation et ajustement fin sur la tâche, avec early stopping. L'analyse des erreurs a conduit à fusionner des classes proches et confondues (tristesse, dégoût, colère), ce qui a nettement amélioré l'exactitude du modèle.

Une mission courte mais complète sur le cycle d'un projet NLP : de la qualité des données au choix de l'architecture et à l'évaluation (exactitude, précision/rappel, matrice de confusion).

  • NLP
  • CamemBERT
  • LSTM
  • TensorFlow / Keras
  • Hugging Face
  • Python