Elastic net
Regresión lineal con ambas penalizaciones a la vez: la L1 de lasso para
dispersión, la L2 de ridge para estabilidad.
Una perilla, la proporción de mezcla, se desliza de ridge a lasso. El default
cuando tienes muchas features correlacionadas y quieres dispersión sin que
lasso elija favoritas.
El problema: features correlacionadas
s1 y s2 — colesterol y LDL — correlacionan en 0.897. Lasso se queda con una y
suelta la otra al azar; ridge conserva ambas pero nunca pone nada en cero.
El objetivo
L(w,b)=2n1i∑(y^i−yi)2+λ[α∥w∥1+21−α∥w∥22]
- λ — fuerza de penalización. α — la mezcla L1/L2.
- α=1 → lasso puro. α=0 → ridge puro.
- Elastic net es la combinación convexa; esos son sus extremos.
La actualización: soft-threshold sobre un factor de encogimiento
wj←1+λ(1−α)S(ρj,λα),S(z,γ)=sign(z)max(∣z∣−γ,0)
- Numerador: la parte L1 — soft-threshold, puede mandar un coeficiente a exactamente cero.
- Denominador: la parte L2 — un encogimiento constante que amarra las features correlacionadas entre sí.
- Cíclalo sobre los coeficientes (descenso por coordenadas) hasta que dejen de moverse.
Míralo: barrido de ridge → lasso
Fija λ=1, barre α de 0 (ridge) a 1 (lasso), reajustando
desde cero en cada frame. Mira el ajuste denso de ridge volverse disperso.
Diez coeficientes distintos de cero bajo ridge; siete bajo lasso. Mira a s2
desaparecer en el extremo derecho — eso es lasso rompiendo el grupo
correlacionado.
El efecto de agrupamiento
Mismo λ, tres regímenes. Ridge y elastic net mantienen junto el par
s1/s2; lasso vierte todo en s1 (-4.84) y corta s2 a cero.
Desde cero vs. librería
Descenso por coordenadas vs. sklearn.linear_model.ElasticNet, mismos
λ y α, pacientes de diabetes apartados.
R² de prueba 0.3653 para ambos — los coeficientes coinciden hasta catorce
decimales. Un solo minimizador convexo, todo solver correcto lo encuentra.
Conclusiones
- El default para muchas features correlacionadas: dispersión sin la inestabilidad de lasso.
- La parte L2 amarra los coeficientes correlacionados entre sí (el efecto de agrupamiento); la parte L1 igual pone en cero el peso muerto.
- En estos datos la penalización no compró exactitud (R² ≈ 0.37 de cualquier forma) — compró un vector de coeficientes estable y legible.
- No es un tercer modelo. Es la perilla entre ridge y lasso; el ajuste correcto es una búsqueda con validación cruzada, no una adivinanza.