Capítulo 15 · cuando el documento entero simplemente cabe
RAG existía porque los documentos no cabían. Ahora muchos sí.
def ask(document, question):
r = client.responses.create(
model="gpt-5.4-nano",
instructions=f"Answer using this document.\n\n{document}",
input=[{"role": "user", "content": question}])
return r.output_text
Lo nuevo es la escala de lo que va en instructions.
| Contexto largo | RAG |
|---|---|
| Cabe, no puede fallar | Escala más allá de cualquier ventana |
| Relee todo en cada llamada | Trae solo lo necesario |
| Documento único y estable | Corpus grande y cambiante |
No "mejor" — situacional.
Q:, responde a partir de todo¿Cabe en la ventana? Pégalo y sáltate el retrieval. ¿Corpus grande o cambiante? RAG. Cuida la cuenta de tokens y la mitad perdida. Siguiente: prompt caching, costo y latencia — el dinero hecho explícito.