全部場數

021 · 把評測結果餵回 agent 記憶

這場說明多數 agent 失敗在檢索而非生成,並介紹用 utility score 讓記憶跟著執行結果持續學習的做法。

2026-06-2815:37Sonam Pankaj(StarlightSearch)Agent評估開發工具看原片

原標題:User Signal Dies at the Retrieval Boundary - Sonam Pankaj, StarlightSearch

重點摘要

  • agent 為什麼卡關講者引用麥肯錫 2025 報告,指出多數 agent 會反覆卡在同一個任務上失敗,問題大多出在檢索是靜態的,沒辦法跟著結果調整。
  • 評測結果進不去系統eval 套件只會判斷一次輸出的對錯,這個結果卻沒有回饋進 agent 的 context、skill 或記憶檔,工程師只能手動改 prompt、換模型或重新訓練。
  • 記憶要當推理,不是事實現有記憶系統多半只存使用者偏好與對話紀錄,屬於一次性個人化;講者主張記憶應該像客服退款前要先查清算紀錄那樣,帶著情境去推理。
  • 用 utility score 排序記憶把語意相似度乘上「這段記憶過去對任務有沒有幫助」,讓過去的執行結果變成檢索重新排序時的一級訊號,講者稱這套機制為 runtime experience。
  • benchmark 數字說話在 Tau-bench 上政策遵循率從 66% 進步到 76%,加上 skill 機制後到 80%;在 Humanity's Last Exam 這類 agentic benchmark 上,從 baseline 35.7 分一路做到 61.3 分。
  • 仍有沒解決的限制記憶量不夠時只能靠純語意搜尋,也可能出現 utility drift 或雜訊標籤讓分數失真,講者坦言這些問題目前還沒辦法完全解決。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場自介講者是 StarlightSearch 共同創辦人暨執行長,這場要講使用者訊號為什麼會在檢索邊界斷掉,以及如何讓它跨過去。
00:34agent 的定義講者定義 agent 具備推理、呼叫工具、跟真實世界互動、擷取記憶的能力,但指出普遍缺一個「從結果學習」的迴圈。
01:15ReAct 迴圈的缺口用 ReAct 架構說明 agent 目前只會推理、呼叫工具、任務完成就停下來,卻沒辦法從結果中學習,同樣的任務因此一再失敗。
01:34檢索才是元兇講者引用數據指出,多數 agent pipeline 失敗出在檢索而非生成,並引用一位前 CTO 的說法:目前的最佳化方向本身就錯了。
02:12評測訊號斷了線observability 與 eval 都留下完整紀錄,但評測結果沒有回饋進 agent 的 context、skill 或記憶檔,只能靠工程師手動調整。
03:43現有記憶系統的侷限現有記憶多半只存使用者偏好與對話紀錄,屬於一次性個人化,沒辦法根據任務執行的結果調整。
04:21提出 utility score用語意相似度乘上「這段記憶過去對任務有沒有幫助」算出分數,讓過去的執行結果變成檢索重新排序時的一級訊號。
05:40記憶要當推理舉退款客服為例:不是只記住使用者偏好,而是要先查清算紀錄再退款,記憶應該帶著情境去推理,不是死記靜態事實。
06:49Tau-bench 分數提升在 Tau-bench 上,政策遵循率從 66% 進步到 76%,加上 skill 機制之後再提高到 80%。
08:06agentic benchmark 分數在 Humanity's Last Exam 這類 agentic benchmark 上,從 baseline 35.7 分,用記憶系統拿到 58.2 分,refine 過的記憶系統再拿到 61.3 分。
08:48坦承限制講者承認記憶量還不夠時只能靠純語意搜尋,也可能出現 utility drift、雜訊標籤等問題,目前還無法完全解決。
09:48現場 demo 開場講者現場示範一個 product SQL agent,先請它找一款電競滑鼠,這時記憶是空的,agent 找不到商品。
11:49標記失敗後重試講者把這次搜尋結果標記為失敗,agent 更新記憶後再查一次,這次順利找到相關商品,展現 utility score 如何隨回饋調整檢索。
15:03結語講者總結:不用改 system prompt,光靠更新 skill 就能讓 agent 持續進步,並附上聯絡方式。

值得記的話

名詞與人物

StarlightSearch講者共同創辦並擔任執行長的公司,主打 agent 檢索與記憶技術。
ReAct講者用來說明 agent 基本運作方式的架構:推理、呼叫工具,執行成一個迴圈,任務完成就停下來。
utility score講者提出的評分方式,用語意相似度乘上「這段記憶過去對任務有沒有幫助」,決定它在檢索時該排多前面。
Tau-bench用來測試 agent 是否遵守政策的 benchmark,講者用它驗證記憶系統能不能提升表現。
Humanity's Last Exam一個高難度的 agentic benchmark,講者用它比較不同記憶系統之間的分數差異。
Mem0講者提到市面上另一套 agent 記憶方案,只會擷取事實與偏好,不會依執行結果調整。
Ram Sriharsha講者引用他近期的一篇文章,認為目前的 agent 記憶系統一直在為錯的目標做最佳化。

延伸

  • 講者提到 GPT-5.4 已經出現類似「自動汰換過時 system prompt 欄位」的行為,但沒有進一步展開。
  • 講者提到同樣的分數趨勢也出現在 big code bench、long TV 等其他 agentic benchmark 上,但沒有列出實際數字。