← capítulo

Prompt caching, costo y latencia

Capítulo 16 · vuélvelo barato y rápido

La hora

Lee los números

u = response.usage
cached = u.input_tokens_details.cached_tokens
cost = (u.input_tokens*p_in + u.output_tokens*p_out) / 1e6

Revisa usage en cada llamada y la cuenta deja de sorprenderte.

Prompt caching

Manda el mismo prefijo grande dos veces → el cached_tokens de la segunda llamada da un salto, cobrado a una fracción de la tarifa.

Regla de diseño: material estable al FRENTE, material variable ATRÁS. Un timestamp arriba tumba el cache en cada llamada.

Elección de modelo

Modelo pequeño y rápido: ~1/10 del precio y de la espera, suficiente para la mayoría de los prompts.

La habilidad es detectar la minoría de tareas que de verdad necesitan el modelo grande.

Ponlo a trabajar — tres apps

Todos leen los mismos campos de usage que leerás en prod.

Loguéalo siempre

Los costos se cuelan: un retry loop, un prompt que creció, un documento que se hizo más grande.

Los logs de usage por llamada convierten el "¿por qué se duplicó la cuenta?" de una investigación en un query.

Lo que te llevas

Tokens, costo, latencia — en cada respuesta. Lee y loguea usage. Cachea el prefijo estable; usa por defecto el modelo pequeño. Siguiente: vuelve medible la calidad misma — un harness de evaluación.