Trenta colonne che in realta parlano di quattro cose
Aprite un export di processo: trenta misure affiancate, e la maggior parte si muove insieme — tre termocoppie sullo stesso forno, due prese di pressione sulla stessa linea. Leggerle una per una non e solo lento: CONTA DUE VOLTE la stessa cosa.
Cosa fanno le componenti principali. Costruiscono nuovi assi come miscele pesate delle vostre colonne: il primo cattura piu variazione possibile, il secondo il massimo di quel che resta — ognuno indipendente dagli altri.
Leggere una saturazione. E la correlazione fra variabile e componente. Le variabili con saturazioni alte SONO la componente; date a essa il loro nome.
⚠️ L'errore che rovina tutto in silenzio: la scala. Se la temperatura sta intorno a 750 e un rapporto intorno a 0,5, senza standardizzare la varianza della temperatura e migliaia di volte maggiore e la prima componente E la temperatura. Il risultato sembra ragionevolissimo e non insegna nulla.
Il clustering pone un'altra domanda: quali RIGHE stanno insieme. La trappola onesta: k-means restituisce sempre esattamente k cluster, anche nel rumore puro. Conta il punteggio di silhouette.
La discriminante va al contrario. La trappola e valutare il modello sulle stesse righe con cui e stato costruito. La validazione incrociata e il numero onesto — da leggere comunque contro la linea di base.
Cosa fanno le componenti principali. Costruiscono nuovi assi come miscele pesate delle vostre colonne: il primo cattura piu variazione possibile, il secondo il massimo di quel che resta — ognuno indipendente dagli altri.
Leggere una saturazione. E la correlazione fra variabile e componente. Le variabili con saturazioni alte SONO la componente; date a essa il loro nome.
⚠️ L'errore che rovina tutto in silenzio: la scala. Se la temperatura sta intorno a 750 e un rapporto intorno a 0,5, senza standardizzare la varianza della temperatura e migliaia di volte maggiore e la prima componente E la temperatura. Il risultato sembra ragionevolissimo e non insegna nulla.
Il clustering pone un'altra domanda: quali RIGHE stanno insieme. La trappola onesta: k-means restituisce sempre esattamente k cluster, anche nel rumore puro. Conta il punteggio di silhouette.
La discriminante va al contrario. La trappola e valutare il modello sulle stesse righe con cui e stato costruito. La validazione incrociata e il numero onesto — da leggere comunque contro la linea di base.
Provalo nell'app
Analisi → Multivariata: eseguite la PCA su sei colonne, poi disattivate la standardizzazione e rifate.