Cómo evaluar agentes de IA con Jev: el marco LLM-as-judge

 

2026-10-03
Cómo evaluar agentes de IA con Jev (LLM-as-judge)

Evaluar un agente de IA es hacer que otra IA te diga, sin texto, si el trabajo está bien hecho. Jev resuelve el problema del LLM-as-judge: en vez de pedirle un veredicto en prosa, le pedís una decisión tipada con probabilidad calibrada.

Antes, evaluar agentes era un quilombo. Le preguntabas a ChatGPT "¿este output es bueno?" y te devolvía tres párrafos que había que parsear. O un JSON que a veces venía mal formado. O una opinión que cambiaba si le preguntabas dos veces lo mismo.

Jev no genera texto. Devuelve algo como {apto: 0.87, dudoso: 0.11, descartar: 0.02}. Punto. Sin párrafo que limpiar, sin JSON roto, sin un modelo que se desvía y te escribe un ensayo.

Qué es LLM-as-judge y por qué falla con un LLM común

LLM-as-judge es la idea de usar un modelo de lenguaje para juzgar el output de otro modelo. Suena lógico: si el modelo escribe bien, también debería saber leer y calificar. El problema es que un LLM juzga escribiendo.

Cuando le pedís a ChatGPT que evalúe algo, te responde con texto. Ese texto hay que parsearlo, y ahí empiezan los problemas. Un día te devuelve "7/10", al otro "está bien pero le falta contexto", al otro un JSON con un campo que cambió de nombre. Para evaluar 10 outputs, está bien. Para evaluar 10.000, se rompe.

Jev invierte el problema. No juzga escribiendo. Devuelve una decisión estructurada desde el primer token.

Las tres primitivas de Jev: Noul, Choice y Score

Jev tiene tres primitivas. Tres tipos de respuesta, cada una con su forma y su probabilidad calibrada.

Noul devuelve la probabilidad de que algo sea verdadero, un número entre 0 y 1. Sirve para preguntas de sí o no: "¿este output cumple el brief?" te devuelve 0.92, no "probablemente sí".

Choice elige entre un set de opciones. "¿A qué columna va esta card?" con opciones {descartar, dudoso, apto, estrella} te devuelve una sola, con la distribución de probabilidad atrás.

Score puntúa en una escala ordenada. "¿Qué tan urgente es este reclamo?" con escala {baja, media, alta} te devuelve una posición ponderada, no un entero pelado.

Las tres juntas cubren casi cualquier decisión de evaluación: sí o no, clasificar, puntuar.

Cuándo usar Jev para evaluar

No todo va a Jev. La regla que uso:

Decisión pura (clasificar, puntuar, rutear, juzgar, extraer, verificar) va a Jev.

Híbrido (decisión más prosa) se parte. Jev decide el núcleo, un LLM escribe el texto alrededor.

Generación (texto libre, hooks, títulos, resúmenes) va a un LLM. Jev no sirve acá.

Un detalle que me salva de errores: cuando la probabilidad cae entre 0.30 y 0.70, es incierto. En esa banda no decido automático, mando a revisión humana. Es la diferencia entre confiar ciegamente y usar bien una probabilidad calibrada.

Cómo armar una evaluación en la práctica

El patrón es un POST a la API con un estado y preguntas. Sin SDK raro:

{"state": {"document": "..."}, "model": "jev-latest",
 "questions": {"es_bug": {"type": "noul", "instructions": "¿Describe un bug?"}}}

La respuesta es algo como {"answers": {"es_bug": {"noul": 0.95}}}. Nada más que leer.

Para evaluar agentes, el flujo es: definís la pregunta (Noul si es binaria, Choice si es categoría, Score si es grado), mandás el estado y leés el campo correcto del response. Noul devuelve la probabilidad, Choice la opción ganadora, Score el número ponderado. No confundir esos tres campos es la mitad del trabajo.

Cómo validar que la evaluación acierta

Jev no alucina en la forma, pero puede equivocarse en el contenido. Clasificar mal un ticket no es un error de tipo, es un error de criterio. Y eso se valida igual que con cualquier modelo.

El método: agarrá 100 casos que ya clasificaste a mano y pasalos por Jev. Compará. Si Jev acierta el 95% y la probabilidad promedio de sus aciertos es 0.95, la calibración es real. Si acierta el 95% pero dice 0.60, la probabilidad no sirve para nada.

Ese número es el que te dice si podés automatizar la evaluación o si la dejás como asistente de un humano. La probabilidad calibrada es lo único que convierte a Jev en algo en lo que podés delegar.

Preguntas Frecuentes

Las dudas que más surgen

1¿Jev reemplaza a ChatGPT para todo lo de evaluación?

No. Reemplaza las decisiones puras. Para evaluaciones que necesitan prosa o razonamiento extenso, seguís con un LLM. Jev es para el veredicto, no para el argumento.

2¿Qué significa que las probabilidades estén calibradas?

Que cuando Jev dice 0.80, acierta el 80% de las veces. No es un número decorativo. Eso se entrena con RLCD, reinforcement learning para decisiones calibradas, no para que el texto te guste.

3¿En qué banda no debo automatizar la decisión?

Entre 0.30 y 0.70. Ahí la respuesta es incierta y conviene un humano. Fuera de esa banda, la confianza alcanza para decidir solo.

4¿Necesito instalar un SDK para usarlo?

No. Es un POST HTTP simple a la API con un JSON. El SDK es cómodo pero opcional.

Te puede interesar