← capítulo

XGBoost

Gradient boosting, más un objetivo de segundo orden y un árbol regularizado.

El modelo que ganó el Kaggle tabular — construido con tres fórmulas.

Qué cambia respecto al boosting simple

Los datos

Un juguete en 1-D para la animación: 90 puntos ruidosos, 65 de train / 25 de val.

La matemática

Objetivo de Taylor de segundo orden en la ronda t:

L(t)i[gift(xi)+12hift(xi)2]+γT+12λjwj2\mathcal{L}^{(t)} \approx \sum_{i} \left[ g_i\, f_t(x_i) + \tfrac{1}{2} h_i\, f_t(x_i)^2 \right] + \gamma T + \tfrac{1}{2}\lambda \sum_j w_j^2

Peso óptimo de la hoja (la fórmula clave):

wj=GjHj+λw_j^{*} = -\frac{G_j}{H_j + \lambda}

Ganancia del split, con la cuota de gamma por la hoja extra:

Gain=12[GL2HL+λ+GR2HR+λ(GL+GR)2HL+HR+λ]γ\text{Gain} = \frac{1}{2}\left[ \frac{G_L^2}{H_L + \lambda} + \frac{G_R^2}{H_R + \lambda} - \frac{(G_L + G_R)^2}{H_L + H_R + \lambda} \right] - \gamma

G y H son las sumas de gradiente y hessiana de los renglones de una hoja.

Míralo funcionar

Una ronda de boosting por frame: la escalera se pega a la curva, la pérdida cae. 30 rondas, árboles de profundidad 2, shrink 0.3. MSE de train → 0.038, MSE de val → 0.110.

Por qué importa la regularización

RMSE de test por ronda sobre datos reales de diabetes, con tres valores de lambda:

Desde cero vs. librería

El nuestro le sigue el paso al xgboost real (59.50 vs 60.01 de RMSE, predicciones correlacionadas 0.9978). Ambos boosters de segundo orden le ganan al gradient boosting simple (64.29) — doce puntos de RMSE.

Puntos clave