Noticias

Publicación,

Sistemas agénticos: dejar de adivinar y empezar a medir

Por Grégoire Martinon

El problema de la medición

Hoy dominan dos enfoques en la evaluación de los sistemas agénticos y de IA generativa, y ninguno es suficiente.

El LLM juez es barato y escalable, pero está sistemáticamente sesgado. Los LLM jueces favorecen las respuestas largas, dan la razón a sus propias respuestas y producen puntuaciones que no son más que aproximaciones ruidosas.

La anotación humana es la referencia, pero no escala. Una muestra estadísticamente significativa exige miles de etiquetas en cada ciclo, lo que hace económicamente inviable la evaluación continua.

Como resultado, muchos equipos de producto lanzan sistemas cuyo rendimiento real desconocen, iteran sobre métricas en las que no pueden confiar y no tienen una forma fiable de detectar cuándo se degrada el rendimiento de un sistema.

Una tercera vía: la inferencia asistida por predicción

En lugar de elegir entre el juicio humano y el automático, la inferencia asistida por predicción (prediction-powered inference) los combina. Un pequeño conjunto de etiquetas humanas sirve para estimar y corregir el sesgo sistemático del LLM juez sobre grandes volúmenes de juicios automáticos. El resultado: intervalos de confianza válidos y estrechos, por una fracción del coste de anotación.

La técnica subyacente, publicada en Science, no pide al LLM juez que acierte. Le pide que se equivoque de forma constante y medible. Una vez caracterizado el sesgo, se puede corregir.

GLIDE

GLIDE es la biblioteca de Python de código abierto de Emerton Data que pone estas técnicas de vanguardia al alcance de cualquier profesional, con un conjunto de muestreadores que optimizan el uso de tu presupuesto de anotación. Estructura la evaluación en tres etapas:

  • Muestreo: repartir de forma óptima tu presupuesto de anotación.
  • Anotación: recoger el conjunto mínimo necesario de etiquetas humanas.
  • Estimación: obtener una métrica sin sesgo, con intervalos de confianza formales.

Con unas pocas líneas de código, los equipos pueden combinar las puntuaciones de un LLM con una pequeña muestra anotada por personas para obtener estimaciones de rendimiento que pueden defender ante sus colegas, sus partes interesadas y ante sí mismos.

GLIDE no se queda en la evaluación puntual. Extiende las mismas estimaciones al seguimiento continuo en producción: sigue el rendimiento del sistema a lo largo del tiempo y señala cualquier deriva estadísticamente significativa antes de que se convierta en un problema de negocio.

GLIDE está disponible en GitHub y PyPI. El equipo de desarrollo comparte sus avances y casos de uso reales en un boletín mensual en LinkedIn.

Las organizaciones que miden con precisión iteran más rápido, detectan antes las regresiones y toman mejores decisiones de despliegue.