全部場數

073 · 幫 Agent 裝上一顆存檔鍵

講者示範用 checkpoint 與重播,幫 agent 補上存檔鍵,讓開發者能事後測試換模型、換工具會不會改變結果,而不是只憑一次重播下結論。

2026-07-1817:07Hamza Tahir(ZenML)Agent開發工具評估看原片

原標題:Your Agents Need a Save Button - Hamza Tahir, ZenML

重點摘要

  • trace 不等於存檔trace 只留下唯讀的呼叫紀錄,agent 執行當下的變數、檔案狀態、程式碼多半沒被保留,事後很難重現原本的執行環境。
  • 有狀態才能重播如果 runtime 能像自動存檔一樣逐步 checkpoint,事後就能換模型、mock 工具,甚至故意注入錯誤來做「如果當初」的實驗。
  • checkpoint、replay、diff、decide 是新的評測循環從正式環境挑出貴、慢或有風險的一批執行紀錄,重播並排比對差異,再決定要不要真的改動並上線。
  • 單次重播不能當結論Braintrust 的研究與 tau-bench 的數據都顯示,換便宜模型看似省錢,但一次重播只是個案,要拉到一整批(cohort)才看得出真實影響。
  • Kitaru 示範了整套流程ZenML 推出的這個工具在 harness 底下加一層可 checkpoint、可重播的 runtime,示範裡把模型換便宜、把工具 mock 掉,再用 diff 跟 MCP server 讓 LLM 自己分析整批結果。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場點出 agent 執行沒有像文件一樣的存檔功能,出了問題也回不去問「為什麼會這樣」。
00:36trace 的局限trace 只是唯讀快照,跟 runtime 實際執行環境脫節,狀態大多遺失。
01:41重播能問的問題有了狀態快照,才能事後換模型、mock 工具、故意注入錯誤來測試。
02:46舉例:退款爭議 agent用一個處理退款爭議的客服 agent 說明,如果 runtime 逐步 checkpoint,就能事後看換成更小的模型是否也能處理、該不該升級給人工。
03:24收尾成循環把重播結果跟既有的評測(evals)串起來:挑出一批可疑的執行紀錄,重播、比對,再決定要不要真的上線。
04:11DoorDash 案例靠重播客服對話做模擬,把原本要幾小時的驗證壓到 5 分鐘,幻覺少 90%。
04:59demo 開場:介紹 KitaruZenML 推出的新工具,在 harness 之下加一層可 checkpoint、可重播的 runtime。
06:23demo:換成更便宜的模型重播從某個 checkpoint 換成 GPT-5 nano 重跑,前面已執行過的步驟全部跳過。
07:45demo:mock 掉工具重播保持模型不變,改用另一個 lookup policy 的結果,測試決策會不會不同。
09:09demo:diff 三線比對把原始跑法跟兩次重播並排比較,結果因為換了 policy 而分流:兩個重播從「需要人工審核」變成「可以直接放行」,代價是更便宜的 token 用量。
11:01擴大到整個 cohort用 replay many 一次對一批執行紀錄做相同的改動,而不是只測單一個案例。
12:10用 MCP server 分析 cohort讓 LLM 讀重播產生的 JSON 報告,自己挑出該注意的紅旗。
14:17Braintrust 與 tau-bench 的提醒換便宜模型可能只是帳面好看的假性經濟,能通過測試的模型自我一致的比例也不高,單次重播不能當結論。
15:54cohort 分析結論:不該換模型雖然單一次重播看起來更便宜、結果一樣,拉大到整批客服案例後,agent 建議不要換成便宜模型。
16:30結語Kitaru 已經開源,歡迎大家去看 repo 並回饋。

值得記的話

名詞與人物

ZenML講者所屬公司,原本做 ML/agent 工作流程的編排工具,這場示範的是新的 runtime 產品。
KitaruZenML 新推出的工具,墊在 agent harness 之下負責 checkpoint 狀態,支援重播、diff 與批次分析。
DoorDash案例公司,靠重播客服對話做模擬驗證,把測試時間從數小時縮到 5 分鐘。
Braintrust提出研究,指出換成便宜模型可能只是帳面好看的假性經濟。
tau-bench講者引用的評測基準,用來說明模型的自我一致性有多低。
GPT-5 nanodemo 中用來取代原模型的便宜選項,用以測試換模型後的行為差異。

延伸

  • DoorDash 在 6 月 1 日發布的部落格文章,講者提到但沒有細講實際做法。
  • Braintrust 那篇關於假性經濟的研究,只提到結論,沒有給出細節。
  • Kitaru 的 MCP server 能做哪些分析,示範裡只示範了抓紅旗的例子,沒有再展開其他用法。