Trinta colunas que na verdade falam de quatro coisas
Abra uma exportação de processo: trinta medições lado a lado, e a maioria se move junta — três termopares no mesmo forno, duas tomadas de pressão na mesma linha. Lê-las uma a uma não é só lento: CONTA DUAS VEZES a mesma coisa.
O que as componentes principais fazem. Constroem novos eixos como misturas ponderadas das suas colunas: o primeiro capta o máximo de variação, o segundo o máximo do que sobra — cada um independente dos outros.
Ler uma carga. É a correlação entre variável e componente. As variáveis com cargas altas SÃO a componente; dê a ela esse nome.
⚠️ O erro que arruína tudo em silêncio: a escala. Se a temperatura gira em 750 e uma razão em 0,5, sem padronizar a variância da temperatura é milhares de vezes maior e a primeira componente É a temperatura. O resultado parece razoável e não ensina nada.
O agrupamento faz outra pergunta: quais LINHAS vão juntas. A armadilha honesta: k-means devolve sempre exatamente k clusters, mesmo em ruído puro. O que importa é a silhueta.
O discriminante roda ao contrário. A armadilha é pontuar o modelo nas mesmas linhas com que foi ajustado. A validação cruzada é o número honesto — e ainda assim deve ser lido contra a linha de base.
O que as componentes principais fazem. Constroem novos eixos como misturas ponderadas das suas colunas: o primeiro capta o máximo de variação, o segundo o máximo do que sobra — cada um independente dos outros.
Ler uma carga. É a correlação entre variável e componente. As variáveis com cargas altas SÃO a componente; dê a ela esse nome.
⚠️ O erro que arruína tudo em silêncio: a escala. Se a temperatura gira em 750 e uma razão em 0,5, sem padronizar a variância da temperatura é milhares de vezes maior e a primeira componente É a temperatura. O resultado parece razoável e não ensina nada.
O agrupamento faz outra pergunta: quais LINHAS vão juntas. A armadilha honesta: k-means devolve sempre exatamente k clusters, mesmo em ruído puro. O que importa é a silhueta.
O discriminante roda ao contrário. A armadilha é pontuar o modelo nas mesmas linhas com que foi ajustado. A validação cruzada é o número honesto — e ainda assim deve ser lido contra a linha de base.
Experimente na aplicação
Analises → Multivariada: rode PCA com seis colunas, depois desligue a padronizacao e rode de novo.