Qué es el machine learning
No escribas las reglas. Escribe cómo se ve una buena regla, y deja que la
computadora encuentre la que se ajusta a tus datos.
El curso completo, en una idea.
Programar vs. aprender
- Programar: conoces la regla, la escribes.
- Machine learning: no conoces la regla, pero tienes ejemplos de ella — y quieres que la computadora la recupere.
- Vale la pena cuando la regla es real pero demasiado grande o difusa para codificarla a mano (spam, tumores), y va derivando.
- No vale la pena cuando la regla es corta y estable. Ahí solo escribe la regla.
Historia
- 1959 — el programa de damas de Arthur Samuel que mejora solo acuña "machine learning".
- 1958 — el perceptrón de Rosenblatt aprende una frontera a partir de ejemplos, pesos empujados por los errores.
- Años 70–80 — los sistemas expertos intentan codificar el conocimiento a mano en miles de reglas if-then. Se pudren.
- El regreso: dejar de escribir reglas, mostrarle ejemplos a la máquina, dejar que infiera. Esa apuesta es toda la materia.
Dos sabores, los mismos puntos
Izquierda: tú diste las etiquetas, el modelo aprende una frontera. Derecha: sin
etiquetas, el modelo descubre los grupos.
Todo el campo, una línea
θ∗=argθminN1i=1∑Nℓ(fθ(xi),yi)
- fθ — el modelo. Cámbialo → umbral, árbol, red.
- ℓ — la pérdida. Cámbiala → lo que significa "equivocado".
- argmin — el algoritmo de entrenamiento. Cámbialo → fuerza bruta, gradientes.
Elige esas tres cosas y especificaste un método de aprendizaje por completo.
Aprender = reducir la pérdida
Desliza el umbral, mira cómo la tasa de clasificación errónea cae hasta su
mínimo. Ese descenso es el algoritmo entero.
Fit, predict, evaluar
- Ambos aprendices sacan 1.000 de accuracy de prueba (fracción de puntos reservados correctos, sin unidades 0–1) — el set de juguete es separable por diseño.
- El clustering no supervisado saca un índice de Rand ajustado de 1.000 contra los ids de blob sellados — estructura recuperada sin etiquetas.
- scikit-learn hace ambas cosas en una línea cada una, con la interfaz
.fit / .predict que todo capítulo posterior reutiliza.
Conclusiones
- Cada capítulo es el mismo ciclo: elige una familia de modelos, define una pérdida, minimízala sobre los datos, verifica que generaliza.
- El ML vale la pena cuando las reglas son demasiadas o demasiado difusas para codificarlas a mano — y van derivando. Si no, escribe la regla.
- La calidad de los datos le gana a la astucia del algoritmo. Casi siempre.
- Aprende la interfaz
.fit / .predict una vez; después de eso la librería entera es gratis.