Un solo split train/test te da un número, y ese número es en parte suerte.
Aparta cada rebanada por turnos, califica cada una, promedia. Todos tus datos prueban, todos entrenan — solo que nunca al mismo tiempo.
Corta los datos en k folds. Corre k rondas. Cada ronda: un fold apartado, el resto entrena. Rota hasta que cada fold haya sido el conjunto de prueba una vez.
La estimación es el promedio de las k puntuaciones de los folds:
CVk=k1j=1∑ksjPero reporta también la dispersión — qué tan fuerte discreparon los folds:
SDk=k1j=1∑k(sj−CVk)20.75±0.01 y 0.75±0.06 no son el mismo resultado.
Cinco folds sobre 768 pacientes, un cuadro por ronda. El fold apartado marcha a través; la media acumulada se asienta; la banda es ±1 std.
El fold 4 puntúa 0.830, el fold 2 puntúa 0.669 — mismo modelo, rebanada distinta. Media 0.750, banda ±0.057. Esa anchura es la señal honesta.
La etiqueta es 35% positiva. Los folds contiguos simples oscilan entre 0.255 y 0.416 de positivos por fold; los estratificados se mantienen ≈ 0.35 en todos.
Simple ±0.057, estratificado ±0.012. Gratis, y la diferencia entre citable y ruido.
Treinta semillas. Split único 80/20 contra la media de CV de 5 folds. El mismo centro, la cuarta parte de la dispersión.
Split único: 0.739 ± 0.040 (0.649–0.799). Media de CV: 0.739 ± 0.010 (0.718–0.763).