Regresión ridge
Regresión lineal con correa: minimiza el error cuadrático más una penalización
sobre el tamaño de los pesos.
Doma las features correlacionadas y el overfitting — conserva cada feature, solo
que pequeña.
Un término lo cambia todo
- OLS minimiza el error cuadrático. Ridge minimiza el error cuadrático más λ∥w∥22.
- La forma cerrada es la ecuación normal más una diagonal: w=(X⊤X+λI)−1X⊤y.
- El intercepto nunca se penaliza (0 en su lugar de λI).
- λI también hace que X⊤X sea invertible aun cuando las features son colineales.
Para qué molestarse: features correlacionadas
s1 y s2 en los datos de diabetes tienen correlación 0.90. OLS intercambia entre
ellas pesos disparatados que se cancelan; ridge cobra renta y elige pesos
pequeños y estables.
El camino de coeficientes
Cada cuadro es un reajuste real. Sube lambda; cada peso se encoge hacia cero,
los correlacionados más rápido. El panel inferior encuentra el punto dulce.
El MSE de validación toca fondo en lambda ≈ 31.6 — una U genuina, no "más es
mejor".
L2 encoge, no selecciona
Cada coeficiente de ridge es más corto que su gemelo OLS; ninguno queda en cero.
La norma del vector de pesos cae de 45.5 a 40.6.
Desde cero contra librería
Nuestro ridge en forma cerrada y el Ridge de sklearn coinciden a ~1e-13. Ridge
le gana a OLS sin regularizar sobre datos apartados.
R² de test: OLS 0.339 → ridge 0.363. La misma clase de modelo, mejor
generalización.
Conclusiones
- Recurre a ridge cuando los coeficientes son enormes, cambian de signo, o el error de test queda detrás del de entrenamiento.
- Estandariza primero — la penalización compara coeficientes directamente.
- Una sola perilla (lambda); elígela con un barrido de validación o
RidgeCV.
- L2 encoge todos los coeficientes hacia cero pero los conserva. ¿Quieres selección? Eso es lasso (L1). ¿Ambos? Elastic net.