← capítulo

Regresión logística

Conserva la frontera recta. Deja que cada feature vote. Devuelve una probabilidad.

El clasificador lineal por defecto — y el modelo que de verdad vas a poner en producción.

El salto desde el threshold

Los datos

Dos clases, algo de traslape. Una línea recta puede separarlas en su mayoría — pero tiene que inclinarse, porque ambos features cargan señal.

El modelo

Score lineal, y luego lo aplastamos a una probabilidad:

z=wx+bp=σ(z)=11+ezz = w^{\top}x + b \qquad p = \sigma(z) = \frac{1}{1 + e^{-z}}

Entrena minimizando la cross-entropy — la pérdida para la que la sigmoide fue construida:

L=1Ni[yilogpi+(1yi)log(1pi)]\mathcal{L} = -\frac{1}{N}\sum_i \big[\, y_i \log p_i + (1 - y_i)\log(1 - p_i)\,\big]

El gradiente colapsa en el error por los features:

Lw=1Ni(piyi)xi\frac{\partial \mathcal{L}}{\partial w} = \frac{1}{N}\sum_i (p_i - y_i)\,x_i

Un (p - y) limpio. Esa cancelación es la razón por la que aquí no usas error cuadrático.

Míralo entrenar

Cada frame es un paso real de gradiente. La línea naranja es donde p = 0.5; los anillos rojos son los errores actuales; la pérdida cae debajo.

Pesos en cero → sin línea → un corte tosco → rota y se desliza hasta el hueco. 96% en el set de juguete.

La sigmoide

Plana en los extremos (confiada), empinada en el centro (incierta), cruzando 0.5 en z = 0.

Desde cero vs. librería vs. el stump de la semana 1

Diabetes Pima, 537 de entrenamiento / 231 de prueba. Nuestro descenso de gradiente aterriza en la respuesta de sklearn; ambos superan el threshold de un solo feature.

Desde cero 0.7662 · sklearn 0.7662 · stump semana 1 0.7316. Pesos más fuertes: glucosa, IMC, embarazos — en ese orden.

Conclusiones