Máquinas de vectores de soporte con SGD
Encuentra el corredor vacío más ancho entre las dos clases.
Solo los puntos de la orilla — los vectores de soporte — definen la frontera.
Entrénala con descenso de gradiente estocástico sobre el hinge loss.
No es un modelo de los datos — es un modelo de la frontera
- La regresión logística le pedía una probabilidad a cada punto.
- La SVM pregunta: ¿cuál es el hueco más ancho que puedo meter entre las clases?
- Solo importan los puntos cercanos a la orilla. Borra el resto — misma frontera.
- Esos puntos de la orilla son los vectores de soporte. Ellos son el modelo.
Los datos
Dos nubes, 120 puntos, traslape moderado. Una recta separa a la mayoría; unos
cuantos quedan dentro del corredor.
El margen, el hinge, el objetivo
Score y frontera, etiquetas en {-1, +1}:
f(x)=w⊤x+bmargin width=∥w∥2
Margen más ancho significa ∥w∥ más chico. Paga un hinge por invadirlo:
ℓi=max(0,1−yif(xi))
El objetivo de margen suave que minimiza SGD — margen ancho + pocas violaciones:
J=2λ∥w∥2+N1i∑max(0,1−yif(xi))
λ es la perilla: margen ancho vs. pocos puntos adentro.
Mira cómo se acomoda el margen
Cada cuadro es un epoch real. Línea sólida = frontera; punteadas = márgenes (f=±1);
anillos ámbar = vectores de soporte; cruces rojas = errores; el hinge loss cae abajo.
Plano plano → margen enorme → barre hacia adentro y se acomoda. Los vectores de soporte
se desploman de 120 a 33. Hinge final 0.156, ancho de margen 1.27, 6 errores, 0.95 en el
conjunto de juguete.
Desde cero vs. librería vs. el solver exacto
84 de entrenamiento / 36 de prueba. Nuestro SGD, el SGDClassifier(loss="hinge") de
sklearn y el LinearSVC exacto caen todos en la misma frontera.
Los tres: 0.9444. Desde cero w=[1.31,0.97], sklearn [1.30,0.97] — mismo
plano, dos optimizadores. 25 de 84 puntos son vectores de soporte.
Puntos clave
- Maximizar el margen: minimizar ∥w∥. El término L2 es el margen.
- Solo los vectores de soporte definen la frontera — una línea estable, inmune a los puntos fáciles.
- SGD sobre el hinge es lo que hace escalar a la SVM; misma respuesta que el programa cuadrático.
- Regresión logística para una probabilidad calibrada; SVM para la frontera más estable.
- ¿No basta con una recta? El kernel trick la dobla — esto es su caso especial lineal.