← capítulo

Contexto largo y preguntas sobre documentos

Capítulo 15 · cuando el documento entero simplemente cabe

La hora

El anti-RAG

RAG existía porque los documentos no cabían. Ahora muchos sí.

Casi no hay API nueva

def ask(document, question):
    r = client.responses.create(
        model="gpt-5.4-nano",
        instructions=f"Answer using this document.\n\n{document}",
        input=[{"role": "user", "content": question}])
    return r.output_text

Lo nuevo es la escala de lo que va en instructions.

Contexto largo vs RAG

Contexto largoRAG
Cabe, no puede fallarEscala más allá de cualquier ventana
Relee todo en cada llamadaTrae solo lo necesario
Documento único y estableCorpus grande y cambiante

No "mejor" — situacional.

Dos costos ocultos

Ponlo a trabajar — tres apps

Lo que te llevas

¿Cabe en la ventana? Pégalo y sáltate el retrieval. ¿Corpus grande o cambiante? RAG. Cuida la cuenta de tokens y la mitad perdida. Siguiente: prompt caching, costo y latencia — el dinero hecho explícito.