全部場數

002 · 從答案到系統行為的評測轉型

講者說明 agentic 系統的評測為何該從 model 準確率,轉向正式環境裡的系統行為與可靠度。

2026-06-258:12Nishant Gupta(Meta Superintelligence Labs)Agent評估產業觀察看原片

原標題:Production Evals For Agentic AI Systems - Nishant Gupta, Meta Superintelligence Labs

重點摘要

  • 評測要看行為,不只看答案agentic 系統會規劃、呼叫工具、執行流程,評測因此要看系統整體行為對不對,而不是只看輸出的答案。
  • benchmark 分數跟正式環境表現是兩回事benchmark 衡量的是 model 能力,正式環境衡量的是系統行為,兩者落差會隨系統自主性提高而擴大。
  • 失敗模式不只是幻覺agentic 系統的失敗有階層之分,從記憶與檢索等基礎問題,到推理、規劃與多 agent 協調都可能出錯。
  • 用 SRE 的方式看可靠度評測該學 SRE 衡量可靠度、可用性、延遲與復原率的方式,把可靠度當成北極星指標,而不是一味衝高準確率。
  • 正式環境流量本身就是評測資料執行軌跡、使用者結果與人工審查回饋,是組織能拿到最具代表性的評測資料。
  • 評測正在變成基礎架構評測被整合進控制平面,持續觀察、收集遙測、協調人工審查,成為正式 AI 系統運作的一部分,而不是獨立的測試或 QA 流程。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場講者介紹自己在 Meta Superintelligence Labs 負責訓練與推理基礎設施,今天要談 agentic 系統的正式環境評測。
00:19評測認知要重新定義多數人聽到評測就想到 benchmark 分數,但 agentic 系統已經改變了評測的意義。
00:35從答案到行為agentic 系統會規劃、呼叫工具、執行流程,問題變成系統有沒有正確運作,而不是答案對不對。
01:06benchmark 與正式環境的落差benchmark 衡量 model 能力,正式環境衡量系統行為,兩者差距隨自主性提高而擴大。
01:41失敗模式的階層從記憶、檢索、安全等基礎問題,到推理、規劃、多 agent 協調,幻覺只是其中一種失敗模式。
02:38用 SRE 心態看評測目標不是衝高 benchmark 分數,而是讓可靠度成為衡量的北極星指標。
03:17評測金字塔底層是 benchmark,中層是場景模擬,頂層是真實使用者跟正式系統互動的資料,價值最高。
03:50場景取代題目離線評測要模擬客服、程式產生等完整工作流程,評量任務完成率與工具正確性等指標。
04:23正式流量就是評測資料執行軌跡、使用者結果、升級案例等都會變成組織最具代表性的評測資料。
04:41人是評測者人類不該只是備援,而是負責判斷正確性、信任感與安全性的評測來源。
05:02agent 系統持續漂移model、提示詞、工具、使用者行為都會變,漂移通常在使用者抱怨前不會被發現,需要持續監控。
05:35可觀測性與持續評測循環評測不是部署前的單次測試,而是遙測、人工審查、資料回補不斷循環的常態服務。
06:40指標要對應商業結果任務完成率、工具成功率、升級率等指標都直接對應業務結果,準確率反而不是重點。
07:12評測成為控制平面評測被整合進控制平面,持續觀察、收集遙測、協調人工審查,成為正式 AI 系統的基礎架構。
07:50結語四個重點agent 系統要看整體工作流程評測、正式環境遙測是最重要的信號、可靠度比準確率重要,評測正在變成基礎架構。

值得記的話

名詞與人物

Nishant Gupta這場演講的講者,在 Meta Superintelligence Labs 負責訓練與推理基礎設施。
SRESite Reliability Engineer,講者拿 SRE 衡量可靠度與復原率的方式類比 agent 評測。
control plane講者說的控制平面,負責持續觀察系統、收集遙測、協調人工審查,跟負責執行工作的 execution plane 分開。
execution plane實際執行 agent 工作流程的部分,由控制平面負責測量與治理。
telemetry遙測資料,講者認為是正式環境裡最重要的評測訊號來源。

延伸

  • 講者提到的評測金字塔與觀測性圖表,現場只用圖呈現,沒有逐一細講每一層實際怎麼做。
  • agent 系統的漂移會隨 model、提示詞、工具版本更新而發生,但講者沒有說明具體多久該重新評測一次。
  • 多 agent 協調失敗被列為失敗階層之一,但講者沒有進一步說明常見的協調失敗案例。