Conserva la frontera recta. Deja que cada feature vote. Devuelve una probabilidad.
El clasificador lineal por defecto — y el modelo que de verdad vas a poner en producción.
Dos clases, algo de traslape. Una línea recta puede separarlas en su mayoría — pero tiene que inclinarse, porque ambos features cargan señal.
Score lineal, y luego lo aplastamos a una probabilidad:
z=w⊤x+bp=σ(z)=1+e−z1Entrena minimizando la cross-entropy — la pérdida para la que la sigmoide fue construida:
L=−N1i∑[yilogpi+(1−yi)log(1−pi)]El gradiente colapsa en el error por los features:
∂w∂L=N1i∑(pi−yi)xiUn (p - y) limpio. Esa cancelación es la razón por la que aquí no usas error cuadrático.
Cada frame es un paso real de gradiente. La línea naranja es donde p = 0.5; los anillos rojos son los errores actuales; la pérdida cae debajo.
Pesos en cero → sin línea → un corte tosco → rota y se desliza hasta el hueco. 96% en el set de juguete.
Plana en los extremos (confiada), empinada en el centro (incierta), cruzando 0.5 en z = 0.
Diabetes Pima, 537 de entrenamiento / 231 de prueba. Nuestro descenso de gradiente aterriza en la respuesta de sklearn; ambos superan el threshold de un solo feature.
Desde cero 0.7662 · sklearn 0.7662 · stump semana 1 0.7316. Pesos más fuertes: glucosa, IMC, embarazos — en ese orden.
(p - y). No uses error cuadrático.