Con software normal, lo mismo entra y lo mismo sale, siempre. Con IA no: el modelo es probabilístico, así que la misma pregunta puede dar respuestas distintas. "Funcionó en la demo" no significa nada.
I
Por qué cuesta tanto
El problema
No es determinista
Los fallos se esconden
En un agente, la respuesta final es solo el último paso de una cadena larga: planificar, llamar herramientas, razonar. El fallo casi nunca está donde lo ves.
Y los problemas de producción casi siempre superan a tu conjunto de pruebas: pasan cosas que nunca imaginaste.
II
Ver lo que pasa
Observabilidad
La traza · el corazón de la observabilidad
Encuentra la causa raíz
Una traza es el registro de toda la sesión: cada llamada al modelo, a una herramienta, a una búsqueda. Pulsa cada paso de este agente que falló:
Pulsa un paso para inspeccionarlo. El síntoma está al final… pero la causa raíz, en el medio.
Evaluar en tres niveles
¿Dónde miras?
III
Medir la calidad
Las evals
Qué es una eval
Tests unitarios, pero para IA
Una eval es un conjunto de casos de prueba + una métrica que puntúa las respuestas. Igual que un test de software, pero midiendo calidad, no solo "pasa / no pasa".
La clave: integrarlas en el CI/CD. Antes de desplegar un cambio de prompt o de modelo, las evals te dicen si mejoró o empeoró — sin adivinar.
Las métricas que importan
¿Qué se mide?
Fidelidad (faithfulness)
Juez LLM
¿Quién pone la nota?
Código vs juez LLM
Dos formas de puntuar, según lo que midas:
Regla de oro: código para lo exacto (formato, herramienta correcta); juez LLM para lo que requiere criterio (tono, fidelidad, calidad).
El instrumental
Con qué se hace
OPEN-SOURCE / AUTOALOJADO
Langfuse, Arize Phoenix, MLflow, DeepEval, RAGAS — control total de tus datos.
GESTIONADO (SAAS)
LangSmith, Braintrust, AgentOps, Datadog LLM — listos para usar.
GUARDRAILS
Validan entrada/salida: toxicidad, sesgo, fuga de datos (PII), formato.
Estándar emergente: OpenTelemetry (OpenLLMetry) para instrumentar sin atarte a un proveedor. Todos en el Mapa de Herramientas.
La idea para llevarse
Cierra el bucle
1Traza todo lo que hace el agente en producción.
2Evalúa con métricas claras en los tres niveles.
3Corrige y vuelve a medir — los fallos de producción alimentan tu próxima eval.
Sin esto, "mejorar" la IA es adivinar. Con esto, es ingeniería.