全部場數

037 · 打造可驗證、不退步的 agent 學習迴圈

講者說明如何把正式環境裡未被驗證的失敗,轉成可重播、可驗證的學習環境,讓 agent 只進步、不退步。

2026-07-0522:35Soheil Feizi(RELAI)Agent評估開發工具模型看原片

原標題:Continual Learning for AI Agents: From Failures to Durable Improvements - Soheil Feizi, RELAI

重點摘要

  • 持續學習要解決兩個難題一是怎麼知道 agent 做得好不好、該怎麼做才對;二是拿到回饋之後,要改哪一層、怎麼改。
  • 正式環境的 log 不能直接拿來訓練production 只有使用者互動留下的 session log,沒有明確的對錯回饋,必須先靠模型分析或人工專家標註取得回饋,再推論出一套可重播、有明確成功定義的學習環境。
  • 修正可以發生在三層,代價各不相同model 層改權重最貴、最需要明確的 benchmark;harness 層改 prompt、工具或程式碼居中;memory 層寫入事實或技能最便宜最快,卻也最難驗證有沒有真的解決問題。
  • 提出 verifiable continual learning(VCL)主張每一次修正都要被證明有幫助,也要證明沒有破壞原本就做對的事,而不是只看單一案例有沒有變好。
  • VCL 立基於四個原則可重播性、整體性、長期性、效率,分別對應「失敗要能重跑成測試」「一個失敗常牽涉多層,要找對地方修」「新修正不能讓舊案例變差」「整個迴圈要能頻繁且便宜地跑」。
  • 示範顯示這套迴圈確實有效不管是完全沒有 log 的虛構客服 agent,還是已經有 log 與回饋的案例,跑過迴圈後分數都明顯提升,且不影響過去已經做對的行為。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Soheil Feizi 自我介紹:RELAI 創辦人暨 CSO,也是馬里蘭大學電腦科學系副教授,主題是 agent 的持續學習,如何從失敗走到持久的改進。
00:37持續學習的目標人類靠經驗與回饋學習,continual learning 想讓 agent 也能透過行動、拿到回饋來改進,同時不遺忘原本會的事。
01:39兩個核心難題第一是怎麼知道 agent 表現好不好、該怎麼做才對;第二是拿到回饋後,要改哪一層、怎麼改。
02:31回饋從哪裡來開發階段有 benchmark 與 evaluator 可以打分數,但正式環境只有使用者互動留下的 log,沒有明確的對錯回饋。
03:31補回饋的兩條路一條是讓其他模型或程式碼自動分析 log、給出批評,能規模化;另一條是找領域專家看少量 log,給出更貼近實務的判斷。
04:11log 還不能拿來訓練有 log 加回饋仍無法重播測試,得先推論出一套可重播的學習環境:決定工具用真的還是模擬的、合成使用者,以及成功的定義。
06:19修正的三層選擇model 層改權重、harness 層改 prompt 與工具、memory 層寫入事實與技能,好的做法是找最小、最持久的改動來修對地方。
07:51model 層代價最高SFT 靠標註樣本模仿正確軌跡,RL 類方法如 DPO、GRPO、RLVR 依獎勵或偏好訊號優化,LoRA 則限制可調整的參數;這層最貴,也需要明確的 benchmark。
08:39harness 與 memory 層harness 層有 trace-to-harness(請 coding agent 直接改 prompt,但不保證沒有隱藏退步)與 GEPA 這類做搜尋評分的方法;memory 層寫入事實或技能最便宜最快,卻也最難驗證有沒有真的解決問題。
10:52提出 verifiable continual learning目標是讓每一次修正都被證明有效,也證明沒有破壞原本做對的事,做法是建立可重跑的測試、量測修正前後的差異,並對舊測試做回歸測試。
11:54VCL 的四個原則可重播性(把一次性的失敗變成能重跑的測試)、整體性(一個失敗可能牽涉好幾層,要找出真正該修的地方)、長期性(新修正不能讓過去做對的案例變差)、效率(整個迴圈要頻繁且便宜地跑)。
15:50RELAI 的 Learning Loop從 log、回饋或指示等訊號出發,轉成可重播環境、做根因分析並路由到對的層,加上 regression-aware 優化,最後產出一份可審閱的版本更新;只要兩個指令就能接上既有的 agent 框架。
18:24客服 agent 示範針對一個沒有 log 的虛構客服 agent,模擬「來電者態度惡劣」的情境,起始分數不高(78%),針對分數偏低的評估項目跑一輪 optimize 後大幅提升(講者說是從 87% 提升到 97%,平均進步一成)。
20:46示範二:帶著回饋優化給一段不理想的 session 與一句回饋(退款要快,但不能超過額度亂大方),一樣先轉成可重播環境再優化,且不會讓過去的表現變差,可以持續疊加改進。
21:38收尾三個重點與結語很多有用的修正發生在 harness 與 memory 層;production log 不是學習環境,要先轉換才能用;前沿方向是具備回歸感知的持續改進;VCL 立基於四個原則。

值得記的話

名詞與人物

Soheil Feizi這場演講的講者,RELAI 創辦人暨 CSO,也是馬里蘭大學電腦科學系副教授。
RELAI講者創辦的公司,這場示範的持續學習系統(Learning Loop)由這家公司打造。
verifiable continual learning(VCL)講者提出的新分類,主張每次修正都要被證明有效、也證明沒有破壞原本能力。
replayable learning environment把一次性的 log 與回饋,轉換成能重複執行、有明確成功定義的模擬與評測環境。
GEPA一種對 prompt 做搜尋、評分並保留贏家的 harness 層優化方法。
trace-to-harness直接請 coding agent 分析 log 並改善 agent 的做法,但不保證沒有隱藏的退步。
Letta、Mem0講者提到能把事實或修正寫進 agent 記憶層的方法。
RLVR、GRPO、DPO講者提到用來對 model 權重做 RL 類後訓練的方法,依獎勵或偏好訊號優化。
LoRAlow-rank adaptation,限制可調整參數範圍的微調方式,讓 model 層的更新更便宜、更安全。
regression-aware optimization把「不能破壞過去做對的事」直接放進優化過程本身,而不是修完之後再事後補救。

延伸

  • 講者提到呼叫 `rely optimize` 時可以指定 rollout 數量,但沒有說明數量怎麼決定比較好。
  • GEPA、trace-to-harness 等 harness 層方法只點出名稱與大致原理,沒有比較彼此的優缺點。
  • 客服 agent 示範裡分數偏低的兩個評估項目,講者沒有說明具體是哪兩項出了問題。