Détection automatique de démarches anormales à partir de 410 enregistrements de capture de mouvement (17 marqueurs corporels), en comparant six classifieurs, du plus simple au plus sophistiqué, avec et sans réduction de dimension préalable (PCA, LDA). Projet réalisé en équipe avec Florian Dorchies, Nathan Kieffer et Steeve Mbock.
PDF Rapport complet13 pages · features, PCA/LDA, 6 classifieurs, optimisation bayésienne Télécharger →410 fichiers de capture de mouvement (321 démarches normales, 89 anormales), chacun décrivant la trajectoire de 17 marqueurs corporels (poignets, coudes, épaules, hanches, genoux, chevilles…) en coordonnées x/y à chaque instant. Pour éviter la complexité des séries temporelles à longueur variable, trois descripteurs statistiques simples sont extraits de chaque colonne : moyenne, variance et étendue (max − min), soit un vecteur de 102 variables par enregistrement.
Standardisation, PCA et LDA sont systématiquement ajustées sur les données d'entraînement uniquement, puis appliquées au jeu de test, pour garantir une évaluation non biaisée. La PCA (implémentée manuellement) cherche le nombre minimal de composantes expliquant 95% de la variance ; la LDA maximise la séparabilité inter-classes selon le critère de Fisher.
# Prévention de fuite de données : PCA ajustée sur le fold d'entraînement uniquement mean_pca, W_pca = fit_pca(X_train) X_train_pca = transform_pca(X_train) X_test_pca = transform_pca(X_test) # même transformation, aucune info du test
Moindres carrés (référence), régression logistique, SVM linéaire et à noyau RBF, forêt aléatoire (200 arbres) et réseau de neurones (une couche cachée de 25 neurones). Protocole d'évaluation : 30 tirages aléatoires train/test (70/30), avec calcul de l'exactitude, du rappel, de la précision, du F1-score et de l'exactitude équilibrée à chaque itération.
| Classifieur | Brut · Acc. | Brut · F1 | LDA · Acc. | LDA · F1 |
|---|---|---|---|---|
| Moindres carrés | 0,935 | 0,846 | 0,935 | 0,846 |
| Régression logistique | 0,909 | 0,782 | 0,936 | 0,853 |
| SVM linéaire | 0,909 | 0,785 | 0,934 | 0,850 |
| SVM RBF | 0,902 | 0,780 | 0,934 | 0,849 |
| Forêt aléatoire | 0,907 | 0,770 | 0,921 | 0,836 |
| Réseau de neurones | 0,920 | 0,803 | 0,935 | 0,846 |
Résultat marquant : la PCA (pourtant à 99% de variance expliquée avec 3 composantes) dégrade fortement les performances, les classifieurs tendant à tout prédire dans la classe majoritaire (démarche normale, ~70% du jeu). La LDA, supervisée, préserve voire améliore les résultats en concentrant l'information discriminante utile sur son unique axe de projection.
Les hyperparamètres (C, σ) du SVM RBF sont optimisés en espace LDA par processus gaussien, en maximisant le F1-score via la fonction d'amélioration espérée (Expected Improvement). Malgré une exploration sur 12 itérations couvrant C de 0,1 à 100, le F1-score reste bloqué à 0,894 : les hyperparamètres par défaut (C=1, σ=0,5) se situaient déjà dans une région quasi optimale, la séparabilité en espace LDA étant suffisamment bonne pour saturer les gains possibles.
← Retour au portfolio