← Todo el blog

Llevar el RAG agéntico a producción sin el hype

La mayoría de las demos de RAG se caen en producción. Aquí está el pequeño conjunto de cosas que hicieron el mío fiable — y medible.

  • RAG
  • LangGraph
  • Evaluación

La generación aumentada por recuperación queda preciosa en una demo y se rompe en silencio. La distancia entre un notebook y algo que pondrías delante de usuarios reales es, sobre todo, ingeniería poco glamurosa — y unas pocas decisiones que rinden una y otra vez.

Hazlo un grafo, no un pipeline

Una cadena lineal «recuperar → rellenar → responder» no puede recuperarse cuando la recuperación falla. Modelar el flujo como una pequeña máquina de estados — decidir si recuperar, recuperar, comprobar si es suficiente, quizá recuperar otra vez, y luego responder — convierte los callejones sin salida en ramas. LangGraph las hace explícitas en vez de enterrarlas en spaghetti de prompts.

Traza todo desde el primer día

No puedes depurar lo que no puedes ver. Conectar el trazado antes de la primera consulta real hace que cada ejecución muestre los fragmentos recuperados, las llamadas a herramientas y el prompt final. La mitad de «el modelo se equivoca» resulta ser «la recuperación le dio el contexto equivocado».

Evalúa con tus datos, no con intuiciones

Un conjunto de evaluación minúsculo, hecho con preguntas reales, vale más que cualquier benchmark. Cuando cada cambio produce un número, «esto se siente mejor» se convierte en «el recall pasó de 0.71 a 0.83», y puedes ir rápido sin romper la calidad.

Nada de esto es exótico. Es, simplemente, la diferencia entre una demo y un sistema.