Trente colonnes qui parlent en fait de quatre choses

Ouvrez un export de procédé : trente mesures côte à côte, et la plupart bougent ensemble — trois thermocouples sur le même four, deux prises de pression sur la même ligne. Les lire une par une n'est pas seulement lent : cela COMPTE DEUX FOIS la même chose.

Ce que font les composantes principales. Elles construisent de nouveaux axes, mélanges pondérés de vos colonnes, tels que le premier capte le maximum de variation, le deuxième le maximum du reste — chaque axe indépendant des autres.

Lire une saturation. Une saturation est la corrélation entre une variable et une composante. Les variables fortement saturées SONT la composante ; nommez-la d'après elles.

⚠️ L'erreur qui ruine tout en silence : l'échelle. Si la température tourne autour de 750 et un ratio autour de 0,5, sans standardisation la variance de la température est des milliers de fois plus grande et la première composante EST la température. Le résultat paraît parfaitement raisonnable et ne vous apprend rien.

Le clustering pose une autre question : quelles LIGNES vont ensemble. Le piège honnête : k-means renvoie toujours exactement k clusters, même dans du bruit pur. Ce qui compte est le score de silhouette.

L'analyse discriminante fonctionne à l'envers. Le piège est de noter le modèle sur les lignes qui ont servi à l'ajuster. La validation croisée est le chiffre honnête — et il faut encore le lire face au taux de base.
Essayer dans l'application
Analyses → Multivarie : lancez une ACP sur six colonnes, puis desactivez la standardisation et relancez.
Regardez-le sur notre chaîne YouTube

Testez sur vos propres données

Offre gratuite, sans inscription. Fonctionne hors ligne dans le navigateur.

Ouvrir l'application