← capítulo

Validación cruzada

Un solo split train/test te da un número, y ese número es en parte suerte.

Aparta cada rebanada por turnos, califica cada una, promedia. Todos tus datos prueban, todos entrenan — solo que nunca al mismo tiempo.

Por qué un split no basta

La rotación

Corta los datos en k folds. Corre k rondas. Cada ronda: un fold apartado, el resto entrena. Rota hasta que cada fold haya sido el conjunto de prueba una vez.

Dos números, no uno

La estimación es el promedio de las k puntuaciones de los folds:

CVk=1kj=1ksj\mathrm{CV}_k = \frac{1}{k} \sum_{j=1}^{k} s_j

Pero reporta también la dispersión — qué tan fuerte discreparon los folds:

SDk=1kj=1k(sjCVk)2\mathrm{SD}_k = \sqrt{\frac{1}{k} \sum_{j=1}^{k} \left(s_j - \mathrm{CV}_k\right)^2}

0.75±0.010.75 \pm 0.01 y 0.75±0.060.75 \pm 0.06 no son el mismo resultado.

Míralo correr

Cinco folds sobre 768 pacientes, un cuadro por ronda. El fold apartado marcha a través; la media acumulada se asienta; la banda es ±1 std.

El fold 4 puntúa 0.830, el fold 2 puntúa 0.669 — mismo modelo, rebanada distinta. Media 0.750, banda ±0.057. Esa anchura es la señal honesta.

Con etiquetas desbalanceadas, estratifica

La etiqueta es 35% positiva. Los folds contiguos simples oscilan entre 0.255 y 0.416 de positivos por fold; los estratificados se mantienen ≈ 0.35 en todos.

Simple ±0.057, estratificado ±0.012. Gratis, y la diferencia entre citable y ruido.

Por qué es más confiable

Treinta semillas. Split único 80/20 contra la media de CV de 5 folds. El mismo centro, la cuarta parte de la dispersión.

Split único: 0.739 ± 0.040 (0.649–0.799). Media de CV: 0.739 ± 0.010 (0.718–0.763).

Conclusiones