Capítulo 16 · vuélvelo barato y rápido
usageu = response.usage
cached = u.input_tokens_details.cached_tokens
cost = (u.input_tokens*p_in + u.output_tokens*p_out) / 1e6
Revisa usage en cada llamada y la cuenta deja de sorprenderte.
Manda el mismo prefijo grande dos veces → el cached_tokens
de la segunda llamada da un salto, cobrado a una fracción de la tarifa.
Regla de diseño: material estable al FRENTE, material variable ATRÁS. Un timestamp arriba tumba el cache en cada llamada.
Modelo pequeño y rápido: ~1/10 del precio y de la espera, suficiente para la mayoría de los prompts.
La habilidad es detectar la minoría de tareas que de verdad necesitan el modelo grande.
Todos leen los mismos campos de usage que leerás en prod.
Los costos se cuelan: un retry loop, un prompt que creció, un documento que se hizo más grande.
Los logs de usage por llamada convierten el "¿por qué se duplicó la cuenta?" de una investigación en un query.
Tokens, costo, latencia — en cada respuesta. Lee
y loguea usage. Cachea el prefijo estable; usa por
defecto el modelo pequeño. Siguiente: vuelve medible
la calidad misma — un harness de evaluación.