La maldición de la dimensionalidad
Toda la intuición que tienes sobre distancias se entrenó en 2D. En 200D te miente.
El espacio de alta dimensión está casi vacío — y en un espacio vacío, todo está
más o menos igual de lejos de todo.
Dos nombres, dos problemas
- Bellman, 1957 — acuñó "la maldición de la dimensionalidad". Una malla útil
necesita elevar su resolución a la potencia de la dimensión. El trabajo explota.
- Hughes, 1968 — el fenómeno de peaking: con datos fijos, el accuracy sube
con las features, hace pico, y luego baja. Más mediciones, peor modelo.
La misma raíz: el espacio se vacía conforme agregas ejes, y los datos finitos no
alcanzan a seguirle el paso.
Las distancias se concentran
200 puntos aleatorios, distancias ÷ media, conforme sube la dimensión.
El más cercano y el más lejano arrancan a kilómetros de distancia — y convergen
al mismo valor.
Las matemáticas
Contraste relativo — cuánto más lejos está el más lejano que el más cercano:
contrast(q)=minid(q,xi)maxid(q,xi)−minid(q,xi)
Se colapsa (Beyer et al., 1999):
d→∞limcontrast(q)→0
El volumen crece como rd, así que para mantener la misma densidad necesitas
N∝(1/ε)d puntos — exponencial en la dimensión.
Míralo colapsarse
Cada cuadro: 200 puntos nuevos en una dimensión, la dispersión de sus distancias
por pares (÷ media). El más cercano (cian) y el más lejano (naranja) caminan juntos.
El contraste cae de 41.90 en d = 2 a 0.10 en d = 1000.
Cuando el histograma es un pico, "vecino más cercano" no significa nada — y kNN,
k-means y los kernels están corriendo sobre ruido.
El fenómeno de peaking
5 features informativas, el resto puro ruido. kNN hace pico en 5, y luego se cae
del precipicio. Un modelo lineal regularizado casi ni nota el ruido.
kNN: 0.9958 con 5 features → 0.6708 con 500. Logística: sigue en 0.9208 con 500.
Contraatacando
Con 200 features, kNN está atorado en 0.7250. Tres defensas:
- Umbral de varianza: 0.7250 — no hay columnas muertas, no ayuda. No es un filtro de ruido.
- SelectKBest (k=5): 0.9833 — tira el ruido, restaura el contraste.
- PCA (k=5): 0.8542 — no supervisado, así que la recuperación es parcial.
Puntos clave
- Más features no es más señal — pasado el pico de Hughes es activamente menos.
- Los métodos basados en distancia (kNN, k-means, RBF) mueren primero, y mueren en silencio.
- Los árboles y los modelos lineales regularizados ignoran las columnas basura — muchas veces son la mejor respuesta.
- El umbral de varianza limpia constantes, no ruido. SelectKBest es barato y fuerte
pero juzga las features una por una. PCA reduce sin etiquetas.
- Debajo de todo: consigue más datos, o usa menos dimensiones. Nada más escala
contra una exponencial.