← capítulo

Regresión ridge

Regresión lineal con correa: minimiza el error cuadrático más una penalización sobre el tamaño de los pesos.

Doma las features correlacionadas y el overfitting — conserva cada feature, solo que pequeña.

Un término lo cambia todo

Para qué molestarse: features correlacionadas

s1 y s2 en los datos de diabetes tienen correlación 0.90. OLS intercambia entre ellas pesos disparatados que se cancelan; ridge cobra renta y elige pesos pequeños y estables.

El camino de coeficientes

Cada cuadro es un reajuste real. Sube lambda; cada peso se encoge hacia cero, los correlacionados más rápido. El panel inferior encuentra el punto dulce.

El MSE de validación toca fondo en lambda ≈ 31.6 — una U genuina, no "más es mejor".

L2 encoge, no selecciona

Cada coeficiente de ridge es más corto que su gemelo OLS; ninguno queda en cero. La norma del vector de pesos cae de 45.5 a 40.6.

Desde cero contra librería

Nuestro ridge en forma cerrada y el Ridge de sklearn coinciden a ~1e-13. Ridge le gana a OLS sin regularizar sobre datos apartados.

R² de test: OLS 0.339 → ridge 0.363. La misma clase de modelo, mejor generalización.

Conclusiones