Trente colonnes qui parlent en fait de quatre choses

Ouvrez un export de procede : trente mesures cote a cote, et la plupart bougent ensemble — trois thermocouples sur le meme four, deux prises de pression sur la meme ligne. Les lire une par une n'est pas seulement lent : cela COMPTE DEUX FOIS la meme chose.

Ce que font les composantes principales. Elles construisent de nouveaux axes, melanges ponderes de vos colonnes, tels que le premier capte le maximum de variation, le deuxieme le maximum du reste — chaque axe independant des autres.

Lire une saturation. Une saturation est la correlation entre une variable et une composante. Les variables fortement saturees SONT la composante ; nommez-la d'apres elles.

⚠️ L'erreur qui ruine tout en silence : l'echelle. Si la temperature tourne autour de 750 et un ratio autour de 0,5, sans standardisation la variance de la temperature est des milliers de fois plus grande et la premiere composante EST la temperature. Le resultat parait parfaitement raisonnable et ne vous apprend rien.

Le clustering pose une autre question : quelles LIGNES vont ensemble. Le piege honnete : k-means renvoie toujours exactement k clusters, meme dans du bruit pur. Ce qui compte est le score de silhouette.

L'analyse discriminante fonctionne a l'envers. Le piege est de noter le modele sur les lignes qui ont servi a l'ajuster. La validation croisee est le chiffre honnete — et il faut encore le lire face au taux de base.
Essayer dans l'application
Analyses → Multivarie : lancez une ACP sur six colonnes, puis desactivez la standardisation et relancez.
Regardez-le sur notre chaîne YouTube

Testez sur vos propres données

Offre gratuite, sans inscription. Fonctionne hors ligne dans le navigateur.

Ouvrir l'application