全部場數

086 · AI agent 判斷不一致怎麼辦

從情緒分析與資安警示的案例出發,說明 AI agent 為何對同樣輸入給出不同判斷,並用 active learning 找出爭議案例,靠語意記憶與情節記憶補上判斷一致性。

2026-07-2025:38Diane Lin(Datadog)Agent評估模型看原片

原標題:Why Your Agent Disagrees With Itself (And What To Do About It) - Diane Lin, Datadog

重點摘要

  • 同輸入不同判斷的問題情緒分析與資安警示任務中,同一個 AI agent 對相同輸入多次執行,有時會給出不同結論,這不只是隨機性,還會讓客戶對產品失去信任。
  • 不一致集中在決策灰色地帶容易反覆翻盤的案例多半落在分類邊界附近,即使人類專家對這些案例也常有分歧,答案沒有絕對對錯,取決於各家公司自己的政策與偏好。
  • 借用 active learning 找出問題案例傳統機器學習用不確定性分數挑出模型沒把握的資料,但 LLM 的信心分數不可靠;改用多次執行或多個模型之間的意見分歧當訊號,更能抓出真正需要人工複核的案例。
  • 用語意記憶與情節記憶取代重新訓練找出灰色地帶案例後,不必急著微調模型,可以把人工釐清後的判斷準則寫進 semantic memory,或把過去類似案例存進 episodic memory 讓 agent 直接參考,兩者互補,能自動處理大量重複出現的情境。
  • 實驗結果93 筆資安警示重複執行三次,原本四分之一會翻盤;導入 episodic memory 後,其中約 15% 轉為穩定判斷,僅剩約 10% 仍會反覆,多半是缺乏過去參考案例的情況。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Diane Lin 自我介紹經歷,並預告要講 AI agent 為何對同樣輸入給出不同判斷。
02:02點出核心問題指出同樣輸入卻得到語意上不同的輸出,這不只是 LLM 隨機性造成的技術小麻煩。
03:09情緒分析案例舉飯店評論情緒分類為例,同一模型重複執行會對同一則評論給出不同標籤。
04:18資安警示案例換到資安場景:agent 判斷同一則登入異常警示時,也會在良性與可疑之間反覆。
05:34不一致傷信任指出這種反覆判斷會在客戶比較不同廠商時直接影響成交,是信任問題而非小瑕疵。
06:12找出灰色地帶反覆翻盤的案例多半集中在分類邊界附近,這個灰色地帶才是問題根源。
07:21邊界案例沒有標準答案舉例說明邊界案例連人類專家也有分歧,判法要看各公司自己的政策與偏好。
10:52借用 active learning提出解法方向:機器學習裡既有的 active learning,可以用來挑出模型沒把握的資料。
14:22LLM 版本的兩個環節把傳統 active learning 搬到 LLM 上,分成挑選策略與後續補強兩個部分。
14:38用分歧取代信心分數LLM 自己回報的信心分數不可靠,改用多次執行或多模型之間的意見分歧當訊號更準。
15:35不一定要重新訓練找出爭議案例後不急著微調模型,改用 semantic memory 與 episodic memory 這種更輕量的做法。
17:41兩種記憶的分工semantic memory 存放人工蒸餾出的判斷準則,episodic memory 則直接參考過去類似案例,兩者互補。
22:12實驗數字與結論用 93 筆資安警示的實測數字說明方法有效,並總結三個帶得走的重點。

值得記的話

名詞與人物

Diane LinDatadog 自我演進 agent 開發的負責人,這場演講的講者,先前共同創辦資安新創 Cloudmanate。
Datadog收購 Cloudmanate 的可觀測性與資安平台公司,Diane Lin 目前在此帶領 agent 開發工作。
CloudmanateDiane Lin 共同創辦的公司,做的是用 AI agent 自動分類資安警示,後來被 Datadog 收購。
active learning機器學習既有做法,用來從大量未標記資料中,挑出模型最沒把握、最值得人工複核的樣本。
semantic memory把人工釐清過的判斷準則(例如某公司的政策)寫成知識,讓 agent 之後可以直接查詢套用。
episodic memory讓 agent 直接參考過去處理過的相似案例與其結論,不必等人工把道理整理成規則。
query by committeeactive learning 的一種做法,靠比較多個模型(或同一模型跑多次)的判斷是否一致,找出分歧案例。

延伸

  • 講者在結尾提到 Datadog 資安分析師團隊與幾位同事協助這項研究,但沒有進一步說明各自的角色。
  • episodic memory 目前仍有約 10% 的案例無法收斂一致,原因包含缺乏過去相似案例可參考,這部分演講沒有再展開。