El clasificador más simple
Una feature. Una línea. Todos los de arriba, enfermos; los de abajo, sanos.
El modelo más tonto que podría funcionar — y la vara que todo lo demás tiene que superar.
Por qué empezar aquí
- Antes de una red neuronal, averigua cuánto puntúa una línea. Ese es el piso.
- La mayoría nunca mide el piso. Y luego entrega un modelo que apenas lo supera.
- Un umbral de una feature es un decision stump: un árbol con un solo split.
- También es el átomo con el que se arman los modelos grandes — boosting de stumps → AdaBoost, splits apilados → un bosque.
Los datos
768 pacientes de diabetes, ocho mediciones cada uno. Usamos una: glucosa en sangre.
Los dos grupos se traslapan, pero las lecturas de los diabéticos se cargan hacia arriba.
El modelo completo
Predice diabético cuando la glucosa supera un corte:
y^i(θ)=1[gi≥θ]
"Entrenar" es una línea de búsqueda — el corte con la accuracy más alta:
θ∗=argθmaxN1i∑1[y^i(θ)=yi]
Eso es todo. Un argmax sobre un entero.
Mira la búsqueda
Cada cuadro es una iteración real. Los anillos rojos son los errores actuales del corte;
el panel inferior traza la accuracy conforme la línea se mueve.
El trade-off del que no escapas
Corte bajo: atrapas a todos los diabéticos, marcas a la mitad de los sanos. Corte
alto: al revés. Ninguna configuración anula ambos errores.
Dónde pones la línea es una decisión sobre qué error prefieres cometer.
Desde cero vs. librería
DecisionTreeClassifier(max_depth=1) es el mismo modelo. Las barras quedan una
encima de la otra.
Conclusiones
- Ajusta el stump primero, siempre. Es el número que tu modelo real tiene que superar.
- Rankeador de features gratis: dale todas las columnas, y el split que elige es tu mejor señal.
- El átomo del curso: el boosting y los árboles son stumps ensamblados.
- Recurre a algo más pesado cuando un solo corte recto deje accuracy sobre la mesa — que es la mayoría de los problemas reales. Por eso el curso continúa.