Trinta colunas que na verdade falam de quatro coisas

Abra uma exportação de processo: trinta medições lado a lado, e a maioria se move junta — três termopares no mesmo forno, duas tomadas de pressão na mesma linha. Lê-las uma a uma não é só lento: CONTA DUAS VEZES a mesma coisa.

O que as componentes principais fazem. Constroem novos eixos como misturas ponderadas das suas colunas: o primeiro capta o máximo de variação, o segundo o máximo do que sobra — cada um independente dos outros.

Ler uma carga. É a correlação entre variável e componente. As variáveis com cargas altas SÃO a componente; dê a ela esse nome.

⚠️ O erro que arruína tudo em silêncio: a escala. Se a temperatura gira em 750 e uma razão em 0,5, sem padronizar a variância da temperatura é milhares de vezes maior e a primeira componente É a temperatura. O resultado parece razoável e não ensina nada.

O agrupamento faz outra pergunta: quais LINHAS vão juntas. A armadilha honesta: k-means devolve sempre exatamente k clusters, mesmo em ruído puro. O que importa é a silhueta.

O discriminante roda ao contrário. A armadilha é pontuar o modelo nas mesmas linhas com que foi ajustado. A validação cruzada é o número honesto — e ainda assim deve ser lido contra a linha de base.
Experimente na aplicação
Analises → Multivariada: rode PCA com seis colunas, depois desligue a padronizacao e rode de novo.
Veja isto no nosso canal do YouTube

Experimente com os seus dados

Nível gratuito, sem registo. Funciona offline no navegador.

Abrir a aplicação