Evaluar un agente de IA es hacer que otra IA te diga, sin texto, si el trabajo está bien hecho. Jev resuelve el problema del LLM-as-judge: en vez de pedirle un veredicto en prosa, le pedís una decisión tipada con probabilidad calibrada.
Antes, evaluar agentes era un quilombo. Le preguntabas a ChatGPT "¿este output es bueno?" y te devolvía tres párrafos que había que parsear. O un JSON que a veces venía mal formado. O una opinión que cambiaba si le preguntabas dos veces lo mismo.
Jev no genera texto. Devuelve algo como {apto: 0.87, dudoso: 0.11, descartar: 0.02}. Punto. Sin párrafo que limpiar, sin JSON roto, sin un modelo que se desvía y te escribe un ensayo.