HumanForYou — Prédiction de l'attrition des employés (machine learning)
CESI École d'Ingénieurs · 2026
Projet de machine learning pour une entreprise pharmaceutique fictive (~4 400 employés, ~16 % de départs par an) : fusion de cinq sources RH, variables construites à partir des badgeuses, comparaison de modèles ensemblistes, réglage du seuil de décision, audit des biais et démarche éthique selon les 7 exigences de la Commission européenne.
Projet du bloc Intelligence artificielle (machine learning) de 4e année au CESI, réalisé en équipe de trois. Le cas : HumanForYou, une entreprise pharmaceutique basée en Inde, perd chaque année environ 15 % de ses employés, ce qui retarde ses projets et l'oblige à recruter et former en continu. La direction demandait d'identifier les facteurs qui pèsent le plus sur ces départs et de proposer des pistes pour retenir les employés.
Les données venaient de cinq fichiers : profil RH, enquête de qualité de vie au travail, évaluation des managers, et les heures d'arrivée et de départ relevées par les badgeuses sur toute l'année 2015. Plutôt que d'utiliser les 261 colonnes journalières brutes, nous en avons tiré quelques indicateurs par employé : durée moyenne de travail par jour, heure d'arrivée moyenne, taux d'absence. L'analyse exploratoire s'appuyait sur des tests statistiques (t-test et η² pour les variables continues, Chi-2 et V de Cramér pour les catégorielles) : ce sont la durée de travail quotidienne, l'expérience, l'âge, la situation familiale et la fréquence des déplacements qui ressortaient le plus, alors que la note de performance ne jouait aucun rôle.
Côté modélisation, les classes étaient déséquilibrées (84 % / 16 %) : un modèle qui répond toujours « reste » aurait 84 % d'exactitude sans rien détecter. Nous avons donc séparé les données en entraînement, validation et test stratifiés, rééquilibré uniquement l'entraînement avec SMOTE, et jugé les modèles sur l'AUC, le rappel et le F1 plutôt que sur l'exactitude. Quatre modèles ensemblistes ont été comparés (Random Forest, Extra Trees, Gradient Boosting, AdaBoost) ; Extra Trees a été retenu puis optimisé (GridSearchCV puis RandomizedSearchCV). Le seuil de décision a été abaissé sur le jeu de validation, jamais sur le test, parce que manquer un départ coûte plus cher à l'entreprise qu'une action de rétention inutile.
Nous avons aussi vérifié que le modèle ne prédit pas plus de départs qu'il n'y en a réellement pour un genre, une tranche d'âge, un service ou une situation familiale donnés. Le livrable éthique conclut que le score ne doit servir que d'alerte : la décision reste humaine, les données sont agrégées et l'audit des biais est refait à chaque réentraînement. Les recommandations à la direction portaient sur la rémunération des profils juniors, l'intégration pendant les trois premières années, la charge horaire et l'équilibre vie professionnelle-vie personnelle.
Ce projet a été précédé de trois ateliers sur un jeu de données immobilier californien (analyse exploratoire, régression, classification), qui ont posé les bases du pipeline.
- Python
- scikit-learn
- pandas
- Machine Learning
- Classification
- SMOTE
- Éthique de l'IA