021 · 把評測結果餵回 agent 記憶
這場說明多數 agent 失敗在檢索而非生成,並介紹用 utility score 讓記憶跟著執行結果持續學習的做法。
原標題:User Signal Dies at the Retrieval Boundary - Sonam Pankaj, StarlightSearch
重點摘要
- agent 為什麼卡關講者引用麥肯錫 2025 報告,指出多數 agent 會反覆卡在同一個任務上失敗,問題大多出在檢索是靜態的,沒辦法跟著結果調整。
- 評測結果進不去系統eval 套件只會判斷一次輸出的對錯,這個結果卻沒有回饋進 agent 的 context、skill 或記憶檔,工程師只能手動改 prompt、換模型或重新訓練。
- 記憶要當推理,不是事實現有記憶系統多半只存使用者偏好與對話紀錄,屬於一次性個人化;講者主張記憶應該像客服退款前要先查清算紀錄那樣,帶著情境去推理。
- 用 utility score 排序記憶把語意相似度乘上「這段記憶過去對任務有沒有幫助」,讓過去的執行結果變成檢索重新排序時的一級訊號,講者稱這套機制為 runtime experience。
- benchmark 數字說話在 Tau-bench 上政策遵循率從 66% 進步到 76%,加上 skill 機制後到 80%;在 Humanity's Last Exam 這類 agentic benchmark 上,從 baseline 35.7 分一路做到 61.3 分。
- 仍有沒解決的限制記憶量不夠時只能靠純語意搜尋,也可能出現 utility drift 或雜訊標籤讓分數失真,講者坦言這些問題目前還沒辦法完全解決。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場自介 | 講者是 StarlightSearch 共同創辦人暨執行長,這場要講使用者訊號為什麼會在檢索邊界斷掉,以及如何讓它跨過去。 |
| 00:34 | agent 的定義 | 講者定義 agent 具備推理、呼叫工具、跟真實世界互動、擷取記憶的能力,但指出普遍缺一個「從結果學習」的迴圈。 |
| 01:15 | ReAct 迴圈的缺口 | 用 ReAct 架構說明 agent 目前只會推理、呼叫工具、任務完成就停下來,卻沒辦法從結果中學習,同樣的任務因此一再失敗。 |
| 01:34 | 檢索才是元兇 | 講者引用數據指出,多數 agent pipeline 失敗出在檢索而非生成,並引用一位前 CTO 的說法:目前的最佳化方向本身就錯了。 |
| 02:12 | 評測訊號斷了線 | observability 與 eval 都留下完整紀錄,但評測結果沒有回饋進 agent 的 context、skill 或記憶檔,只能靠工程師手動調整。 |
| 03:43 | 現有記憶系統的侷限 | 現有記憶多半只存使用者偏好與對話紀錄,屬於一次性個人化,沒辦法根據任務執行的結果調整。 |
| 04:21 | 提出 utility score | 用語意相似度乘上「這段記憶過去對任務有沒有幫助」算出分數,讓過去的執行結果變成檢索重新排序時的一級訊號。 |
| 05:40 | 記憶要當推理 | 舉退款客服為例:不是只記住使用者偏好,而是要先查清算紀錄再退款,記憶應該帶著情境去推理,不是死記靜態事實。 |
| 06:49 | Tau-bench 分數提升 | 在 Tau-bench 上,政策遵循率從 66% 進步到 76%,加上 skill 機制之後再提高到 80%。 |
| 08:06 | agentic benchmark 分數 | 在 Humanity's Last Exam 這類 agentic benchmark 上,從 baseline 35.7 分,用記憶系統拿到 58.2 分,refine 過的記憶系統再拿到 61.3 分。 |
| 08:48 | 坦承限制 | 講者承認記憶量還不夠時只能靠純語意搜尋,也可能出現 utility drift、雜訊標籤等問題,目前還無法完全解決。 |
| 09:48 | 現場 demo 開場 | 講者現場示範一個 product SQL agent,先請它找一款電競滑鼠,這時記憶是空的,agent 找不到商品。 |
| 11:49 | 標記失敗後重試 | 講者把這次搜尋結果標記為失敗,agent 更新記憶後再查一次,這次順利找到相關商品,展現 utility score 如何隨回饋調整檢索。 |
| 15:03 | 結語 | 講者總結:不用改 system prompt,光靠更新 skill 就能讓 agent 持續進步,並附上聯絡方式。 |
值得記的話
名詞與人物
| StarlightSearch | 講者共同創辦並擔任執行長的公司,主打 agent 檢索與記憶技術。 |
|---|---|
| ReAct | 講者用來說明 agent 基本運作方式的架構:推理、呼叫工具,執行成一個迴圈,任務完成就停下來。 |
| utility score | 講者提出的評分方式,用語意相似度乘上「這段記憶過去對任務有沒有幫助」,決定它在檢索時該排多前面。 |
| Tau-bench | 用來測試 agent 是否遵守政策的 benchmark,講者用它驗證記憶系統能不能提升表現。 |
| Humanity's Last Exam | 一個高難度的 agentic benchmark,講者用它比較不同記憶系統之間的分數差異。 |
| Mem0 | 講者提到市面上另一套 agent 記憶方案,只會擷取事實與偏好,不會依執行結果調整。 |
| Ram Sriharsha | 講者引用他近期的一篇文章,認為目前的 agent 記憶系統一直在為錯的目標做最佳化。 |
延伸
- 講者提到 GPT-5.4 已經出現類似「自動汰換過時 system prompt 欄位」的行為,但沒有進一步展開。
- 講者提到同樣的分數趨勢也出現在 big code bench、long TV 等其他 agentic benchmark 上,但沒有列出實際數字。