N
Novaire
← Índice
Práctica · Producción

Observabilidad
y evals

¿Cómo sabes que tu IA funciona de verdad?

Lanzaste tu agente. ¿Y ahora?

Con software normal, lo mismo entra y lo mismo sale, siempre. Con IA no: el modelo es probabilístico, así que la misma pregunta puede dar respuestas distintas. "Funcionó en la demo" no significa nada.

I
Por qué cuesta tanto

El problema

No es determinista

Los fallos se esconden

En un agente, la respuesta final es solo el último paso de una cadena larga: planificar, llamar herramientas, razonar. El fallo casi nunca está donde lo ves.

Y los problemas de producción casi siempre superan a tu conjunto de pruebas: pasan cosas que nunca imaginaste.

II
Ver lo que pasa

Observabilidad

La traza · el corazón de la observabilidad

Encuentra la causa raíz

Una traza es el registro de toda la sesión: cada llamada al modelo, a una herramienta, a una búsqueda. Pulsa cada paso de este agente que falló:

Pulsa un paso para inspeccionarlo. El síntoma está al final… pero la causa raíz, en el medio.
Evaluar en tres niveles

¿Dónde miras?

III
Medir la calidad

Las evals

Qué es una eval

Tests unitarios, pero para IA

Una eval es un conjunto de casos de prueba + una métrica que puntúa las respuestas. Igual que un test de software, pero midiendo calidad, no solo "pasa / no pasa".

La clave: integrarlas en el CI/CD. Antes de desplegar un cambio de prompt o de modelo, las evals te dicen si mejoró o empeoró — sin adivinar.
Las métricas que importan

¿Qué se mide?

Fidelidad (faithfulness)

Juez LLM

¿Quién pone la nota?

Código vs juez LLM

Dos formas de puntuar, según lo que midas:

Regla de oro: código para lo exacto (formato, herramienta correcta); juez LLM para lo que requiere criterio (tono, fidelidad, calidad).
El instrumental

Con qué se hace

OPEN-SOURCE / AUTOALOJADO
Langfuse, Arize Phoenix, MLflow, DeepEval, RAGAS — control total de tus datos.
GESTIONADO (SAAS)
LangSmith, Braintrust, AgentOps, Datadog LLM — listos para usar.
GUARDRAILS
Validan entrada/salida: toxicidad, sesgo, fuga de datos (PII), formato.

Estándar emergente: OpenTelemetry (OpenLLMetry) para instrumentar sin atarte a un proveedor. Todos en el Mapa de Herramientas.

La idea para llevarse

Cierra el bucle

Sin esto, "mejorar" la IA es adivinar. Con esto, es ingeniería.
Fin · Observabilidad y evals

Lo que no se mide,
no se puede mejorar.

o clic para avanzar 1 / 1