← capítulo

Normalización y estandarización

Pon cada feature en una escala común antes de que el modelo siquiera corra.

A la distancia no le importa el significado — solo la magnitud. Arregla la regla de medir, no los datos.

El problema

La dispersión cruda

Ocho features, un eje compartido. La insulina y la glucosa se estiran a lo ancho; el resto queda aplastado cerca de cero.

Tres transformaciones, una línea cada una

Min-max a una caja fija [0, 1]:

x=xxminxmaxxminx' = \dfrac{x - x_{\min}}{x_{\max} - x_{\min}}

Estandarización — el z-score, media 0 y std 1:

z=xμσz = \dfrac{x - \mu}{\sigma}

Escalado robusto — mediana e IQR, a prueba de outliers:

x=xmedian(x)IQR(x)x' = \dfrac{x - \operatorname{median}(x)}{\operatorname{IQR}(x)}

La única regla en la que puedes equivocarte

Mira al escalado voltear una predicción

La misma consulta, los mismos datos. Solo cambia la regla de medir: espacio crudo → espacio estandarizado.

Crudo: 15 vecinos votan 4 diabetes / 11 no → sin diabetes. Estandarizado: 8 / 7 → diabetes.

Qué le hace el escalado al modelo

k-NN fijo, mismo split, cuatro corridas. Accuracy en test — fracción de pacientes reservados clasificados bien (sin unidades, 0–1).

Crudo 0.745 → estandarizado 0.771. Sin información nueva, solo un cambio de unidades.

Conclusiones