Dreissig Spalten, die eigentlich von vier Dingen handeln

Öffnen Sie einen Prozessexport und Sie finden dreißig Messwerte nebeneinander. Die meisten bewegen sich gemeinsam: drei Thermoelemente am selben Ofen, zwei Druckabgriffe an derselben Leitung. Sie einzeln zu lesen ist nicht nur langsam — es zählt DOPPELT.

Was Hauptkomponenten tun. Sie bilden neue Achsen als gewichtete Mischungen Ihrer Spalten, so dass die erste möglichst viel der Streuung aufnimmt, die zweite möglichst viel vom Rest — jede unabhängig von den anderen. Meist decken wenige Achsen fast alles ab.

Ladungen lesen. Eine Ladung ist die Korrelation zwischen Variable und Komponente. Die Variablen mit großen Ladungen SIND die Komponente; benennen Sie sie danach.

⚠️ Der Fehler, der alles still ruiniert: die Skalierung. Läuft die Temperatur um 750 und ein Verhältnis um 0,5, dann ist die Varianz der Temperatur ohne Standardisierung tausendfach größer und die erste Komponente ist praktisch die Temperatur. Das Ergebnis sieht völlig vernünftig aus — und lehrt Sie nichts.

Clustering stellt eine andere Frage: welche ZEILEN gehören zusammen. Der ehrliche Haken: k-means liefert immer genau k Cluster, auch in reinem Rauschen. Entscheidend ist der Silhouettenwert.

Diskriminanzanalyse läuft rückwärts. Die Falle ist, das Modell an denselben Zeilen zu bewerten, mit denen es angepasst wurde. Kreuzvalidierung ist die ehrliche Zahl — und auch die muss gegen die Basisrate gelesen werden.
In der App ausprobieren
Analysen → Multivariat: PCA mit sechs Spalten, dann Standardisierung ausschalten und erneut rechnen.
Sehen Sie sich das auf unserem YouTube-Kanal an

Mit eigenen Daten ausprobieren

Kostenlose Stufe, keine Anmeldung nötig. Läuft offline im Browser.

App öffnen