Actualités

Publication,

Systèmes agentiques : arrêter de deviner, commencer à mesurer

Par Grégoire Martinon

Le problème de la mesure

Deux approches dominent aujourd’hui l’évaluation des systèmes agentiques et d’IA générative, et aucune n’est satisfaisante.

Le LLM juge est peu coûteux et passe à l’échelle, mais il est systématiquement biaisé. Les LLM juges favorisent les réponses verbeuses, approuvent leurs propres productions et donnent des scores qui ne sont que des approximations bruitées.

L’annotation humaine est la référence, mais elle ne passe pas à l’échelle. Un échantillon statistiquement significatif exige des milliers d’annotations à chaque cycle, ce qui rend l’évaluation continue économiquement intenable.

Résultat : de nombreuses équipes produit livrent des systèmes dont la performance réelle est inconnue, itèrent sur des indicateurs auxquels elles ne peuvent pas se fier, et n’ont aucun moyen fiable de détecter une dégradation de la performance.

Une troisième voie : l’inférence assistée par prédiction

Plutôt que de choisir entre jugement humain et jugement automatique, l’inférence assistée par prédiction (prediction-powered inference) les combine. Un petit ensemble d’annotations humaines sert à estimer et à corriger le biais systématique du LLM juge sur de grands volumes de jugements automatiques. Résultat : des intervalles de confiance valides et resserrés, pour une fraction du coût d’annotation.

La technique sous-jacente, publiée dans Science, ne demande pas au LLM juge d’avoir raison. Elle lui demande de se tromper de façon constante et mesurable. Une fois le biais caractérisé, il peut être corrigé.

GLIDE

GLIDE est la bibliothèque Python open source d’Emerton Data qui met ces techniques de pointe à la portée de tous les praticiens, avec notamment une série d’échantillonneurs qui optimisent l’usage de votre budget d’annotation. Elle structure l’évaluation en trois étapes :

  • Échantillonnage : répartir au mieux votre budget d’annotation.
  • Annotation : recueillir le minimum nécessaire d’annotations humaines.
  • Estimation : produire un indicateur non biaisé, avec de véritables intervalles de confiance.

En quelques lignes de code, les équipes peuvent combiner les scores d’un LLM avec un petit échantillon annoté par des humains, pour obtenir des estimations de performance qu’elles peuvent défendre devant leurs pairs, leurs parties prenantes et elles-mêmes.

GLIDE ne s’arrête pas à l’évaluation ponctuelle. La bibliothèque étend les mêmes estimations au suivi continu en production : elle suit la performance du système dans le temps et signale toute dérive statistiquement significative avant qu’elle ne devienne un problème pour l’entreprise.

GLIDE est disponible sur GitHub et PyPI. L’équipe de développement partage ses avancées et des cas d’usage concrets dans une newsletter mensuelle sur LinkedIn.

Les organisations qui mesurent avec précision itèrent plus vite, repèrent plus tôt les régressions et prennent de meilleures décisions de déploiement.