Treinta columnas que en realidad hablan de cuatro cosas
Abra una exportacion de proceso y encontrara treinta mediciones una al lado de otra, y casi todas se mueven juntas: tres termopares del mismo horno, dos tomas de presion de la misma linea. Leerlas de una en una no solo es lento: CUENTA DOS VECES lo mismo.
Que hacen las componentes principales. Construyen ejes nuevos como mezclas ponderadas de sus columnas, de modo que el primero capte la mayor variacion posible, el segundo la mayor parte de lo que queda — cada uno independiente de los demas.
Leer una carga. Una carga es la correlacion entre una variable y una componente. Las variables con cargas grandes SON la componente; pongale ese nombre.
⚠️ El error que lo arruina todo en silencio: la escala. Si la temperatura ronda 750 y un ratio ronda 0,5, sin estandarizar la varianza de la temperatura es miles de veces mayor y la primera componente ES la temperatura. El resultado parece razonable y no ensena nada.
El agrupamiento hace otra pregunta: que FILAS van juntas. La trampa honesta: k-means devuelve siempre exactamente k clusters, incluso en ruido puro. Lo que importa es la silueta.
El discriminante va al reves. La trampa es puntuar el modelo con las mismas filas con que se ajusto. La validacion cruzada es el numero honesto — y aun asi hay que leerlo frente a la linea base.
Que hacen las componentes principales. Construyen ejes nuevos como mezclas ponderadas de sus columnas, de modo que el primero capte la mayor variacion posible, el segundo la mayor parte de lo que queda — cada uno independiente de los demas.
Leer una carga. Una carga es la correlacion entre una variable y una componente. Las variables con cargas grandes SON la componente; pongale ese nombre.
⚠️ El error que lo arruina todo en silencio: la escala. Si la temperatura ronda 750 y un ratio ronda 0,5, sin estandarizar la varianza de la temperatura es miles de veces mayor y la primera componente ES la temperatura. El resultado parece razonable y no ensena nada.
El agrupamiento hace otra pregunta: que FILAS van juntas. La trampa honesta: k-means devuelve siempre exactamente k clusters, incluso en ruido puro. Lo que importa es la silueta.
El discriminante va al reves. La trampa es puntuar el modelo con las mismas filas con que se ajusto. La validacion cruzada es el numero honesto — y aun asi hay que leerlo frente a la linea base.
Pruébalo en la app
Analisis → Multivariante: ejecute PCA con seis columnas, luego desactive la estandarizacion y repita.