News

Publikation,

Agentische Systeme: aufhören zu raten, anfangen zu messen

Von Grégoire Martinon

Das Messproblem

Zwei Ansätze dominieren heute die Evaluierung agentischer und generativer KI-Systeme, und keiner reicht aus.

Der LLM-Richter ist günstig und skalierbar, aber systematisch verzerrt. LLM-Richter bevorzugen ausführliche Antworten, bewerten ihre eigenen Ergebnisse wohlwollend und liefern Werte, die bestenfalls verrauschte Näherungen sind.

Menschliche Annotation ist der Goldstandard, aber nicht skalierbar. Eine statistisch belastbare Stichprobe erfordert in jedem Zyklus Tausende Annotationen, was eine kontinuierliche Evaluierung wirtschaftlich unmöglich macht.

Die Folge: Viele Produktteams bringen Systeme auf den Markt, deren tatsächliche Leistung sie nicht kennen, iterieren auf Kennzahlen, denen sie nicht vertrauen können, und haben keine verlässliche Möglichkeit zu erkennen, wann die Leistung eines Systems nachlässt.

Ein dritter Weg: Prediction-Powered Inference

Statt zwischen menschlichem und maschinellem Urteil zu wählen, kombiniert Prediction-Powered Inference beide. Eine kleine Menge menschlicher Annotationen dient dazu, die systematische Verzerrung des LLM-Richters über große Mengen maschineller Urteile zu schätzen und zu korrigieren. Das Ergebnis: gültige, enge Konfidenzintervalle zu einem Bruchteil der Annotationskosten.

Die zugrunde liegende Technik, veröffentlicht in Science, verlangt nicht, dass der LLM-Richter recht hat. Sie verlangt nur, dass er sich konsistent und messbar irrt. Ist die Verzerrung einmal beschrieben, lässt sie sich korrigieren.

GLIDE

GLIDE ist die Open-Source-Python-Bibliothek von Emerton Data, die diese modernen Techniken allen Praktikern zugänglich macht, mit einer Reihe von Samplern, die den Einsatz Ihres Annotationsbudgets optimieren. Sie gliedert die Evaluierung in drei Schritte:

  • Stichprobe: Ihr Annotationsbudget optimal verteilen.
  • Annotation: die minimal nötige Menge menschlicher Annotationen erheben.
  • Schätzung: eine unverzerrte Kennzahl mit formalen Konfidenzintervallen liefern.

Mit wenigen Codezeilen können Teams LLM-Bewertungen mit einer kleinen, von Menschen annotierten Stichprobe kombinieren und so Leistungsschätzungen erhalten, die sie gegenüber Kollegen, Stakeholdern und sich selbst vertreten können.

GLIDE endet nicht bei der punktuellen Evaluierung. Die Bibliothek überträgt dieselben Schätzungen auf die kontinuierliche Überwachung im Betrieb: Sie verfolgt die Leistung des Systems über die Zeit und meldet jede statistisch signifikante Abweichung, bevor daraus ein Geschäftsproblem wird.

GLIDE ist auf GitHub und PyPI verfügbar. Das Entwicklungsteam teilt Fortschritte und reale Anwendungsfälle in einem monatlichen Newsletter auf LinkedIn.

Organisationen, die präzise messen, iterieren schneller, erkennen Rückschritte früher und treffen bessere Entscheidungen über den Einsatz ihrer Systeme.