我們協助團隊擺脫一個錯誤的兩難:成本低但有偏差的「LLM 評審」分數,與準確但昂貴的人工審核。
GLIDE 把少量人工標註的樣本,與大規模的自動標註結合,並運用預測輔助推論(prediction-powered inference)修正評審模型的偏差,而不是忽略它。
結果是無偏差的表現估算,附有正式的信賴區間,涵蓋整個流程:由最佳抽樣及標註,到估算及正式運作時的持續監察。
GLIDE 以經同行評審的統計方法為基礎,並以開源形式發佈,讓團隊得到經得起同儕、持份者以至自己檢驗的指標。
Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation