News

Pubblicazione,

Sistemi agentici: smettere di indovinare e iniziare a misurare

Di Grégoire Martinon

Il problema della misurazione

Oggi due approcci dominano la valutazione dei sistemi agentici e di IA generativa, e nessuno dei due è sufficiente.

L’LLM giudice è economico e scalabile, ma sistematicamente distorto. Gli LLM giudici favoriscono le risposte prolisse, approvano i propri output e producono punteggi che sono solo approssimazioni rumorose.

L’annotazione umana è il riferimento, ma non scala. Un campione statisticamente significativo richiede migliaia di annotazioni a ogni ciclo, il che rende la valutazione continua economicamente insostenibile.

Di conseguenza molti team di prodotto rilasciano sistemi di cui non conoscono le prestazioni reali, iterano su metriche di cui non possono fidarsi e non hanno un modo affidabile per accorgersi quando le prestazioni di un sistema peggiorano.

Una terza via: l’inferenza basata sulle predizioni

Invece di scegliere tra giudizio umano e giudizio automatico, l’inferenza basata sulle predizioni (prediction-powered inference) li combina. Un piccolo insieme di annotazioni umane serve a stimare e correggere la distorsione sistematica dell’LLM giudice su grandi volumi di giudizi automatici. Il risultato: intervalli di confidenza validi e stretti, a una frazione del costo di annotazione.

La tecnica sottostante, pubblicata su Science, non chiede all’LLM giudice di avere ragione. Gli chiede di sbagliare in modo costante e misurabile. Una volta caratterizzata, la distorsione può essere corretta.

GLIDE

GLIDE è la libreria Python open source di Emerton Data che rende queste tecniche d’avanguardia accessibili a ogni professionista, con una serie di campionatori che ottimizzano l’uso del budget di annotazione. Struttura la valutazione in tre fasi:

  • Campionamento: ripartire in modo ottimale il budget di annotazione.
  • Annotazione: raccogliere il numero minimo necessario di annotazioni umane.
  • Stima: produrre una metrica non distorta, con intervalli di confidenza formali.

Con poche righe di codice, i team possono combinare i punteggi di un LLM con un piccolo campione annotato da persone per ottenere stime di performance che possono difendere davanti ai colleghi, agli stakeholder e a sé stessi.

GLIDE non si ferma alla valutazione puntuale. Estende le stesse stime al monitoraggio continuo in produzione: segue le prestazioni del sistema nel tempo e segnala ogni deriva statisticamente significativa prima che diventi un problema per il business.

GLIDE è disponibile su GitHub e PyPI. Il team di sviluppo condivide i propri progressi e casi d’uso reali in una newsletter mensile su LinkedIn.

Le organizzazioni che misurano con precisione iterano più velocemente, individuano prima le regressioni e prendono decisioni di deployment migliori.