最新消息

刊物,

代理式系統:別再猜測,開始量度

作者: Grégoire Martinon

量度的難題

評估代理式及生成式人工智能系統,現時主要有兩種方法,但兩者都不足夠。

LLM 評審成本低、易於擴展,卻存在系統性偏差。 LLM 評審偏好冗長的回答,傾向肯定自己的輸出,給出的分數只是帶雜訊的近似值。

人工標註是黃金標準,卻難以擴展。 要取得具統計意義的樣本,每個週期都需要數以千計的標註,令持續評估在經濟上難以維持。

結果,不少產品團隊推出的系統,真實表現無從得知;他們依據不可靠的指標反覆調整,也沒有可靠的方法察覺系統表現何時下滑。

第三條路:預測輔助推論

預測輔助推論(prediction-powered inference)不需在人工與自動判斷之間二擇其一,而是把兩者結合。少量人工標註用來估算並修正 LLM 評審在大量自動判斷中的系統性偏差,從而以一小部分的標註成本,得出有效而收窄的信賴區間。

這項技術發表於 Science,它不要求 LLM 評審永遠正確,只要求它的錯誤穩定而可量度。只要掌握偏差的特性,就能加以修正。

GLIDE

GLIDE 是 Emerton Data 的開源 Python 程式庫,讓每位從業者都能使用這些尖端技術,並提供一系列抽樣工具,善用您的標註預算。它把評估分為三個步驟:

  • 抽樣:以最佳方式分配標註預算。
  • 標註:收集所需的最少人工標註。
  • 估算:得出無偏差的指標,並附有正式的信賴區間。

只需幾行程式碼,團隊便可把 LLM 分數與一小批人工標註樣本結合,得出經得起同儕、持份者以至自己檢驗的表現估算。

GLIDE 不止於一次性的評估。它把同樣的估算延伸至正式運作時的持續監察:追蹤系統表現,並在統計上顯著的偏移演變成業務問題之前發出提示。

GLIDE 可在 GitHub 及 PyPI 下載。開發團隊每月在 LinkedIn 通訊中分享最新進展及實際應用案例。

能夠準確量度的機構,迭代更快、更早發現退步,並能作出更好的部署決策。