Treinta columnas que en realidad hablan de cuatro cosas
Abra una exportación de proceso y encontrará treinta mediciones una al lado de otra, y casi todas se mueven juntas: tres termopares del mismo horno, dos tomas de presión de la misma línea. Leerlas de una en una no solo es lento: CUENTA DOS VECES lo mismo.
Qué hacen las componentes principales. Construyen ejes nuevos como mezclas ponderadas de sus columnas, de modo que el primero capte la mayor variación posible, el segundo la mayor parte de lo que queda — cada uno independiente de los demás.
Leer una carga. Una carga es la correlación entre una variable y una componente. Las variables con cargas grandes SON la componente; póngale ese nombre.
⚠️ El error que lo arruina todo en silencio: la escala. Si la temperatura ronda 750 y un ratio ronda 0,5, sin estandarizar la varianza de la temperatura es miles de veces mayor y la primera componente ES la temperatura. El resultado parece razonable y no enseña nada.
El agrupamiento hace otra pregunta: qué FILAS van juntas. La trampa honesta: k-means devuelve siempre exactamente k clusters, incluso en ruido puro. Lo que importa es la silueta.
El discriminante va al revés. La trampa es puntuar el modelo con las mismas filas con que se ajustó. La validación cruzada es el número honesto — y aun así hay que leerlo frente a la línea base.
Qué hacen las componentes principales. Construyen ejes nuevos como mezclas ponderadas de sus columnas, de modo que el primero capte la mayor variación posible, el segundo la mayor parte de lo que queda — cada uno independiente de los demás.
Leer una carga. Una carga es la correlación entre una variable y una componente. Las variables con cargas grandes SON la componente; póngale ese nombre.
⚠️ El error que lo arruina todo en silencio: la escala. Si la temperatura ronda 750 y un ratio ronda 0,5, sin estandarizar la varianza de la temperatura es miles de veces mayor y la primera componente ES la temperatura. El resultado parece razonable y no enseña nada.
El agrupamiento hace otra pregunta: qué FILAS van juntas. La trampa honesta: k-means devuelve siempre exactamente k clusters, incluso en ruido puro. Lo que importa es la silueta.
El discriminante va al revés. La trampa es puntuar el modelo con las mismas filas con que se ajustó. La validación cruzada es el número honesto — y aun así hay que leerlo frente a la línea base.
Pruébalo en la app
Analisis → Multivariante: ejecute PCA con seis columnas, luego desactive la estandarizacion y repita.