037 · 打造可驗證、不退步的 agent 學習迴圈
講者說明如何把正式環境裡未被驗證的失敗,轉成可重播、可驗證的學習環境,讓 agent 只進步、不退步。
原標題:Continual Learning for AI Agents: From Failures to Durable Improvements - Soheil Feizi, RELAI
重點摘要
- 持續學習要解決兩個難題一是怎麼知道 agent 做得好不好、該怎麼做才對;二是拿到回饋之後,要改哪一層、怎麼改。
- 正式環境的 log 不能直接拿來訓練production 只有使用者互動留下的 session log,沒有明確的對錯回饋,必須先靠模型分析或人工專家標註取得回饋,再推論出一套可重播、有明確成功定義的學習環境。
- 修正可以發生在三層,代價各不相同model 層改權重最貴、最需要明確的 benchmark;harness 層改 prompt、工具或程式碼居中;memory 層寫入事實或技能最便宜最快,卻也最難驗證有沒有真的解決問題。
- 提出 verifiable continual learning(VCL)主張每一次修正都要被證明有幫助,也要證明沒有破壞原本就做對的事,而不是只看單一案例有沒有變好。
- VCL 立基於四個原則可重播性、整體性、長期性、效率,分別對應「失敗要能重跑成測試」「一個失敗常牽涉多層,要找對地方修」「新修正不能讓舊案例變差」「整個迴圈要能頻繁且便宜地跑」。
- 示範顯示這套迴圈確實有效不管是完全沒有 log 的虛構客服 agent,還是已經有 log 與回饋的案例,跑過迴圈後分數都明顯提升,且不影響過去已經做對的行為。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | Soheil Feizi 自我介紹:RELAI 創辦人暨 CSO,也是馬里蘭大學電腦科學系副教授,主題是 agent 的持續學習,如何從失敗走到持久的改進。 |
| 00:37 | 持續學習的目標 | 人類靠經驗與回饋學習,continual learning 想讓 agent 也能透過行動、拿到回饋來改進,同時不遺忘原本會的事。 |
| 01:39 | 兩個核心難題 | 第一是怎麼知道 agent 表現好不好、該怎麼做才對;第二是拿到回饋後,要改哪一層、怎麼改。 |
| 02:31 | 回饋從哪裡來 | 開發階段有 benchmark 與 evaluator 可以打分數,但正式環境只有使用者互動留下的 log,沒有明確的對錯回饋。 |
| 03:31 | 補回饋的兩條路 | 一條是讓其他模型或程式碼自動分析 log、給出批評,能規模化;另一條是找領域專家看少量 log,給出更貼近實務的判斷。 |
| 04:11 | log 還不能拿來訓練 | 有 log 加回饋仍無法重播測試,得先推論出一套可重播的學習環境:決定工具用真的還是模擬的、合成使用者,以及成功的定義。 |
| 06:19 | 修正的三層選擇 | model 層改權重、harness 層改 prompt 與工具、memory 層寫入事實與技能,好的做法是找最小、最持久的改動來修對地方。 |
| 07:51 | model 層代價最高 | SFT 靠標註樣本模仿正確軌跡,RL 類方法如 DPO、GRPO、RLVR 依獎勵或偏好訊號優化,LoRA 則限制可調整的參數;這層最貴,也需要明確的 benchmark。 |
| 08:39 | harness 與 memory 層 | harness 層有 trace-to-harness(請 coding agent 直接改 prompt,但不保證沒有隱藏退步)與 GEPA 這類做搜尋評分的方法;memory 層寫入事實或技能最便宜最快,卻也最難驗證有沒有真的解決問題。 |
| 10:52 | 提出 verifiable continual learning | 目標是讓每一次修正都被證明有效,也證明沒有破壞原本做對的事,做法是建立可重跑的測試、量測修正前後的差異,並對舊測試做回歸測試。 |
| 11:54 | VCL 的四個原則 | 可重播性(把一次性的失敗變成能重跑的測試)、整體性(一個失敗可能牽涉好幾層,要找出真正該修的地方)、長期性(新修正不能讓過去做對的案例變差)、效率(整個迴圈要頻繁且便宜地跑)。 |
| 15:50 | RELAI 的 Learning Loop | 從 log、回饋或指示等訊號出發,轉成可重播環境、做根因分析並路由到對的層,加上 regression-aware 優化,最後產出一份可審閱的版本更新;只要兩個指令就能接上既有的 agent 框架。 |
| 18:24 | 客服 agent 示範 | 針對一個沒有 log 的虛構客服 agent,模擬「來電者態度惡劣」的情境,起始分數不高(78%),針對分數偏低的評估項目跑一輪 optimize 後大幅提升(講者說是從 87% 提升到 97%,平均進步一成)。 |
| 20:46 | 示範二:帶著回饋優化 | 給一段不理想的 session 與一句回饋(退款要快,但不能超過額度亂大方),一樣先轉成可重播環境再優化,且不會讓過去的表現變差,可以持續疊加改進。 |
| 21:38 | 收尾三個重點與結語 | 很多有用的修正發生在 harness 與 memory 層;production log 不是學習環境,要先轉換才能用;前沿方向是具備回歸感知的持續改進;VCL 立基於四個原則。 |
值得記的話
名詞與人物
| Soheil Feizi | 這場演講的講者,RELAI 創辦人暨 CSO,也是馬里蘭大學電腦科學系副教授。 |
|---|---|
| RELAI | 講者創辦的公司,這場示範的持續學習系統(Learning Loop)由這家公司打造。 |
| verifiable continual learning(VCL) | 講者提出的新分類,主張每次修正都要被證明有效、也證明沒有破壞原本能力。 |
| replayable learning environment | 把一次性的 log 與回饋,轉換成能重複執行、有明確成功定義的模擬與評測環境。 |
| GEPA | 一種對 prompt 做搜尋、評分並保留贏家的 harness 層優化方法。 |
| trace-to-harness | 直接請 coding agent 分析 log 並改善 agent 的做法,但不保證沒有隱藏的退步。 |
| Letta、Mem0 | 講者提到能把事實或修正寫進 agent 記憶層的方法。 |
| RLVR、GRPO、DPO | 講者提到用來對 model 權重做 RL 類後訓練的方法,依獎勵或偏好訊號優化。 |
| LoRA | low-rank adaptation,限制可調整參數範圍的微調方式,讓 model 層的更新更便宜、更安全。 |
| regression-aware optimization | 把「不能破壞過去做對的事」直接放進優化過程本身,而不是修完之後再事後補救。 |
延伸
- 講者提到呼叫 `rely optimize` 時可以指定 rollout 數量,但沒有說明數量怎麼決定比較好。
- GEPA、trace-to-harness 等 harness 層方法只點出名稱與大致原理,沒有比較彼此的優缺點。
- 客服 agent 示範裡分數偏低的兩個評估項目,講者沒有說明具體是哪兩項出了問題。