Dreissig Spalten, die eigentlich von vier Dingen handeln
Oeffnen Sie einen Prozessexport und Sie finden dreissig Messwerte nebeneinander. Die meisten bewegen sich gemeinsam: drei Thermoelemente am selben Ofen, zwei Druckabgriffe an derselben Leitung. Sie einzeln zu lesen ist nicht nur langsam — es zaehlt DOPPELT.
Was Hauptkomponenten tun. Sie bilden neue Achsen als gewichtete Mischungen Ihrer Spalten, so dass die erste moeglichst viel der Streuung aufnimmt, die zweite moeglichst viel vom Rest — jede unabhaengig von den anderen. Meist decken wenige Achsen fast alles ab.
Ladungen lesen. Eine Ladung ist die Korrelation zwischen Variable und Komponente. Die Variablen mit grossen Ladungen SIND die Komponente; benennen Sie sie danach.
⚠️ Der Fehler, der alles still ruiniert: die Skalierung. Laeuft die Temperatur um 750 und ein Verhaeltnis um 0,5, dann ist die Varianz der Temperatur ohne Standardisierung tausendfach groesser und die erste Komponente ist praktisch die Temperatur. Das Ergebnis sieht voellig vernuenftig aus — und lehrt Sie nichts.
Clustering stellt eine andere Frage: welche ZEILEN gehoeren zusammen. Der ehrliche Haken: k-means liefert immer genau k Cluster, auch in reinem Rauschen. Entscheidend ist der Silhouettenwert.
Diskriminanzanalyse laeuft rueckwaerts. Die Falle ist, das Modell an denselben Zeilen zu bewerten, mit denen es angepasst wurde. Kreuzvalidierung ist die ehrliche Zahl — und auch die muss gegen die Basisrate gelesen werden.
Was Hauptkomponenten tun. Sie bilden neue Achsen als gewichtete Mischungen Ihrer Spalten, so dass die erste moeglichst viel der Streuung aufnimmt, die zweite moeglichst viel vom Rest — jede unabhaengig von den anderen. Meist decken wenige Achsen fast alles ab.
Ladungen lesen. Eine Ladung ist die Korrelation zwischen Variable und Komponente. Die Variablen mit grossen Ladungen SIND die Komponente; benennen Sie sie danach.
⚠️ Der Fehler, der alles still ruiniert: die Skalierung. Laeuft die Temperatur um 750 und ein Verhaeltnis um 0,5, dann ist die Varianz der Temperatur ohne Standardisierung tausendfach groesser und die erste Komponente ist praktisch die Temperatur. Das Ergebnis sieht voellig vernuenftig aus — und lehrt Sie nichts.
Clustering stellt eine andere Frage: welche ZEILEN gehoeren zusammen. Der ehrliche Haken: k-means liefert immer genau k Cluster, auch in reinem Rauschen. Entscheidend ist der Silhouettenwert.
Diskriminanzanalyse laeuft rueckwaerts. Die Falle ist, das Modell an denselben Zeilen zu bewerten, mit denen es angepasst wurde. Kreuzvalidierung ist die ehrliche Zahl — und auch die muss gegen die Basisrate gelesen werden.
In der App ausprobieren
Analysen → Multivariat: PCA mit sechs Spalten, dann Standardisierung ausschalten und erneut rechnen.