002 · 從答案到系統行為的評測轉型
講者說明 agentic 系統的評測為何該從 model 準確率,轉向正式環境裡的系統行為與可靠度。
原標題:Production Evals For Agentic AI Systems - Nishant Gupta, Meta Superintelligence Labs
重點摘要
- 評測要看行為,不只看答案agentic 系統會規劃、呼叫工具、執行流程,評測因此要看系統整體行為對不對,而不是只看輸出的答案。
- benchmark 分數跟正式環境表現是兩回事benchmark 衡量的是 model 能力,正式環境衡量的是系統行為,兩者落差會隨系統自主性提高而擴大。
- 失敗模式不只是幻覺agentic 系統的失敗有階層之分,從記憶與檢索等基礎問題,到推理、規劃與多 agent 協調都可能出錯。
- 用 SRE 的方式看可靠度評測該學 SRE 衡量可靠度、可用性、延遲與復原率的方式,把可靠度當成北極星指標,而不是一味衝高準確率。
- 正式環境流量本身就是評測資料執行軌跡、使用者結果與人工審查回饋,是組織能拿到最具代表性的評測資料。
- 評測正在變成基礎架構評測被整合進控制平面,持續觀察、收集遙測、協調人工審查,成為正式 AI 系統運作的一部分,而不是獨立的測試或 QA 流程。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 講者介紹自己在 Meta Superintelligence Labs 負責訓練與推理基礎設施,今天要談 agentic 系統的正式環境評測。 |
| 00:19 | 評測認知要重新定義 | 多數人聽到評測就想到 benchmark 分數,但 agentic 系統已經改變了評測的意義。 |
| 00:35 | 從答案到行為 | agentic 系統會規劃、呼叫工具、執行流程,問題變成系統有沒有正確運作,而不是答案對不對。 |
| 01:06 | benchmark 與正式環境的落差 | benchmark 衡量 model 能力,正式環境衡量系統行為,兩者差距隨自主性提高而擴大。 |
| 01:41 | 失敗模式的階層 | 從記憶、檢索、安全等基礎問題,到推理、規劃、多 agent 協調,幻覺只是其中一種失敗模式。 |
| 02:38 | 用 SRE 心態看評測 | 目標不是衝高 benchmark 分數,而是讓可靠度成為衡量的北極星指標。 |
| 03:17 | 評測金字塔 | 底層是 benchmark,中層是場景模擬,頂層是真實使用者跟正式系統互動的資料,價值最高。 |
| 03:50 | 場景取代題目 | 離線評測要模擬客服、程式產生等完整工作流程,評量任務完成率與工具正確性等指標。 |
| 04:23 | 正式流量就是評測資料 | 執行軌跡、使用者結果、升級案例等都會變成組織最具代表性的評測資料。 |
| 04:41 | 人是評測者 | 人類不該只是備援,而是負責判斷正確性、信任感與安全性的評測來源。 |
| 05:02 | agent 系統持續漂移 | model、提示詞、工具、使用者行為都會變,漂移通常在使用者抱怨前不會被發現,需要持續監控。 |
| 05:35 | 可觀測性與持續評測循環 | 評測不是部署前的單次測試,而是遙測、人工審查、資料回補不斷循環的常態服務。 |
| 06:40 | 指標要對應商業結果 | 任務完成率、工具成功率、升級率等指標都直接對應業務結果,準確率反而不是重點。 |
| 07:12 | 評測成為控制平面 | 評測被整合進控制平面,持續觀察、收集遙測、協調人工審查,成為正式 AI 系統的基礎架構。 |
| 07:50 | 結語四個重點 | agent 系統要看整體工作流程評測、正式環境遙測是最重要的信號、可靠度比準確率重要,評測正在變成基礎架構。 |
值得記的話
名詞與人物
| Nishant Gupta | 這場演講的講者,在 Meta Superintelligence Labs 負責訓練與推理基礎設施。 |
|---|---|
| SRE | Site Reliability Engineer,講者拿 SRE 衡量可靠度與復原率的方式類比 agent 評測。 |
| control plane | 講者說的控制平面,負責持續觀察系統、收集遙測、協調人工審查,跟負責執行工作的 execution plane 分開。 |
| execution plane | 實際執行 agent 工作流程的部分,由控制平面負責測量與治理。 |
| telemetry | 遙測資料,講者認為是正式環境裡最重要的評測訊號來源。 |
延伸
- 講者提到的評測金字塔與觀測性圖表,現場只用圖呈現,沒有逐一細講每一層實際怎麼做。
- agent 系統的漂移會隨 model、提示詞、工具版本更新而發生,但講者沒有說明具體多久該重新評測一次。
- 多 agent 協調失敗被列為失敗階層之一,但講者沒有進一步說明常見的協調失敗案例。