Trinta colunas que na verdade falam de quatro coisas
Abra uma exportacao de processo: trinta medicoes lado a lado, e a maioria se move junta — tres termopares no mesmo forno, duas tomadas de pressao na mesma linha. Le-las uma a uma nao e so lento: CONTA DUAS VEZES a mesma coisa.
O que as componentes principais fazem. Constroem novos eixos como misturas ponderadas das suas colunas: o primeiro capta o maximo de variacao, o segundo o maximo do que sobra — cada um independente dos outros.
Ler uma carga. E a correlacao entre variavel e componente. As variaveis com cargas altas SAO a componente; de a ela esse nome.
⚠️ O erro que arruina tudo em silencio: a escala. Se a temperatura gira em 750 e uma razao em 0,5, sem padronizar a variancia da temperatura e milhares de vezes maior e a primeira componente E a temperatura. O resultado parece razoavel e nao ensina nada.
O agrupamento faz outra pergunta: quais LINHAS vao juntas. A armadilha honesta: k-means devolve sempre exatamente k clusters, mesmo em ruido puro. O que importa e a silhueta.
O discriminante roda ao contrario. A armadilha e pontuar o modelo nas mesmas linhas com que foi ajustado. A validacao cruzada e o numero honesto — e ainda assim deve ser lido contra a linha de base.
O que as componentes principais fazem. Constroem novos eixos como misturas ponderadas das suas colunas: o primeiro capta o maximo de variacao, o segundo o maximo do que sobra — cada um independente dos outros.
Ler uma carga. E a correlacao entre variavel e componente. As variaveis com cargas altas SAO a componente; de a ela esse nome.
⚠️ O erro que arruina tudo em silencio: a escala. Se a temperatura gira em 750 e uma razao em 0,5, sem padronizar a variancia da temperatura e milhares de vezes maior e a primeira componente E a temperatura. O resultado parece razoavel e nao ensina nada.
O agrupamento faz outra pergunta: quais LINHAS vao juntas. A armadilha honesta: k-means devolve sempre exatamente k clusters, mesmo em ruido puro. O que importa e a silhueta.
O discriminante roda ao contrario. A armadilha e pontuar o modelo nas mesmas linhas com que foi ajustado. A validacao cruzada e o numero honesto — e ainda assim deve ser lido contra a linha de base.
Experimente na aplicação
Analises → Multivariada: rode PCA com seis colunas, depois desligue a padronizacao e rode de novo.