← capítulo

La maldición de la dimensionalidad

Toda la intuición que tienes sobre distancias se entrenó en 2D. En 200D te miente.

El espacio de alta dimensión está casi vacío — y en un espacio vacío, todo está más o menos igual de lejos de todo.

Dos nombres, dos problemas

La misma raíz: el espacio se vacía conforme agregas ejes, y los datos finitos no alcanzan a seguirle el paso.

Las distancias se concentran

200 puntos aleatorios, distancias ÷ media, conforme sube la dimensión.

El más cercano y el más lejano arrancan a kilómetros de distancia — y convergen al mismo valor.

Las matemáticas

Contraste relativo — cuánto más lejos está el más lejano que el más cercano:

contrast(q)=maxid(q,xi)minid(q,xi)minid(q,xi)\text{contrast}(q) = \frac{\max_i \, d(q, x_i) - \min_i \, d(q, x_i)}{\min_i \, d(q, x_i)}

Se colapsa (Beyer et al., 1999):

limd  contrast(q)    0\lim_{d \to \infty} \; \text{contrast}(q) \; \to \; 0

El volumen crece como rdr^d, así que para mantener la misma densidad necesitas N(1/ε)dN \propto (1/\varepsilon)^{d} puntos — exponencial en la dimensión.

Míralo colapsarse

Cada cuadro: 200 puntos nuevos en una dimensión, la dispersión de sus distancias por pares (÷ media). El más cercano (cian) y el más lejano (naranja) caminan juntos.

El contraste cae de 41.90 en d = 2 a 0.10 en d = 1000.

Cuando el histograma es un pico, "vecino más cercano" no significa nada — y kNN, k-means y los kernels están corriendo sobre ruido.

El fenómeno de peaking

5 features informativas, el resto puro ruido. kNN hace pico en 5, y luego se cae del precipicio. Un modelo lineal regularizado casi ni nota el ruido.

kNN: 0.9958 con 5 features → 0.6708 con 500. Logística: sigue en 0.9208 con 500.

Contraatacando

Con 200 features, kNN está atorado en 0.7250. Tres defensas:

Puntos clave