Encuentra los ejes a lo largo de los cuales los datos varían más. Quédate con los primeros. Descarta el resto.
Reducción de dimensionalidad no supervisada — sin etiquetas, solo estructura.
Una nube inclinada y correlacionada es redundante: una dirección larga carga casi todo, la perpendicular carga las sobras.
PC1 apunta a lo largo de la mayor varianza. PC2 es perpendicular y guarda el resto. Ejes nuevos, mezclas de los viejos, elegidos para que el primero capture la mayor dispersión.
Quédate con PC1, descarta PC2, y la imagen apenas cambia.
150 puntos, un blob gaussiano estirado e inclinado unos 33 grados fuera del eje.
Centrar, luego la covarianza, luego sus eigenvectores:
x~i=xi−xˉ C=N−11X~⊤X~ Cvj=λjvjCada eigenvector es una dirección principal; su eigenvalor es la varianza a lo largo de ella. Proyecta sobre los k principales: zi=Vk⊤x~i.
Aparecen los ejes. La nube rota hasta que PC1 queda horizontal. Cada punto cae sobre PC1; los muñones grises son los residuales de PC2 descartados. Eigenvectores reales, cambio de base real.
PC1 por sí solo guarda el 92.7% de la varianza, así que la caída apenas mueve nada.
El PCA ve cuatro números por flor, nunca la especie. Dos componentes cargan el 97.77% de la varianza — la gráfica de abajo es casi todo el dataset.
Las especies emergen de la proyección sin que se las hayan mostrado jamás.
Eigendescomposición de la covarianza contra la SVD de sklearn. La misma respuesta: PC1 0.9246, PC2 0.0531. Los componentes coinciden a ~1e-14 tras corregir la ambigüedad de signo.
Un eigenvector está definido hasta el signo — un componente volteado es la ambigüedad, no un bug.