073 · 幫 Agent 裝上一顆存檔鍵
講者示範用 checkpoint 與重播,幫 agent 補上存檔鍵,讓開發者能事後測試換模型、換工具會不會改變結果,而不是只憑一次重播下結論。
原標題:Your Agents Need a Save Button - Hamza Tahir, ZenML
重點摘要
- trace 不等於存檔trace 只留下唯讀的呼叫紀錄,agent 執行當下的變數、檔案狀態、程式碼多半沒被保留,事後很難重現原本的執行環境。
- 有狀態才能重播如果 runtime 能像自動存檔一樣逐步 checkpoint,事後就能換模型、mock 工具,甚至故意注入錯誤來做「如果當初」的實驗。
- checkpoint、replay、diff、decide 是新的評測循環從正式環境挑出貴、慢或有風險的一批執行紀錄,重播並排比對差異,再決定要不要真的改動並上線。
- 單次重播不能當結論Braintrust 的研究與 tau-bench 的數據都顯示,換便宜模型看似省錢,但一次重播只是個案,要拉到一整批(cohort)才看得出真實影響。
- Kitaru 示範了整套流程ZenML 推出的這個工具在 harness 底下加一層可 checkpoint、可重播的 runtime,示範裡把模型換便宜、把工具 mock 掉,再用 diff 跟 MCP server 讓 LLM 自己分析整批結果。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 點出 agent 執行沒有像文件一樣的存檔功能,出了問題也回不去問「為什麼會這樣」。 |
| 00:36 | trace 的局限 | trace 只是唯讀快照,跟 runtime 實際執行環境脫節,狀態大多遺失。 |
| 01:41 | 重播能問的問題 | 有了狀態快照,才能事後換模型、mock 工具、故意注入錯誤來測試。 |
| 02:46 | 舉例:退款爭議 agent | 用一個處理退款爭議的客服 agent 說明,如果 runtime 逐步 checkpoint,就能事後看換成更小的模型是否也能處理、該不該升級給人工。 |
| 03:24 | 收尾成循環 | 把重播結果跟既有的評測(evals)串起來:挑出一批可疑的執行紀錄,重播、比對,再決定要不要真的上線。 |
| 04:11 | DoorDash 案例 | 靠重播客服對話做模擬,把原本要幾小時的驗證壓到 5 分鐘,幻覺少 90%。 |
| 04:59 | demo 開場:介紹 Kitaru | ZenML 推出的新工具,在 harness 之下加一層可 checkpoint、可重播的 runtime。 |
| 06:23 | demo:換成更便宜的模型重播 | 從某個 checkpoint 換成 GPT-5 nano 重跑,前面已執行過的步驟全部跳過。 |
| 07:45 | demo:mock 掉工具重播 | 保持模型不變,改用另一個 lookup policy 的結果,測試決策會不會不同。 |
| 09:09 | demo:diff 三線比對 | 把原始跑法跟兩次重播並排比較,結果因為換了 policy 而分流:兩個重播從「需要人工審核」變成「可以直接放行」,代價是更便宜的 token 用量。 |
| 11:01 | 擴大到整個 cohort | 用 replay many 一次對一批執行紀錄做相同的改動,而不是只測單一個案例。 |
| 12:10 | 用 MCP server 分析 cohort | 讓 LLM 讀重播產生的 JSON 報告,自己挑出該注意的紅旗。 |
| 14:17 | Braintrust 與 tau-bench 的提醒 | 換便宜模型可能只是帳面好看的假性經濟,能通過測試的模型自我一致的比例也不高,單次重播不能當結論。 |
| 15:54 | cohort 分析結論:不該換模型 | 雖然單一次重播看起來更便宜、結果一樣,拉大到整批客服案例後,agent 建議不要換成便宜模型。 |
| 16:30 | 結語 | Kitaru 已經開源,歡迎大家去看 repo 並回饋。 |
值得記的話
名詞與人物
| ZenML | 講者所屬公司,原本做 ML/agent 工作流程的編排工具,這場示範的是新的 runtime 產品。 |
|---|---|
| Kitaru | ZenML 新推出的工具,墊在 agent harness 之下負責 checkpoint 狀態,支援重播、diff 與批次分析。 |
| DoorDash | 案例公司,靠重播客服對話做模擬驗證,把測試時間從數小時縮到 5 分鐘。 |
| Braintrust | 提出研究,指出換成便宜模型可能只是帳面好看的假性經濟。 |
| tau-bench | 講者引用的評測基準,用來說明模型的自我一致性有多低。 |
| GPT-5 nano | demo 中用來取代原模型的便宜選項,用以測試換模型後的行為差異。 |
延伸
- DoorDash 在 6 月 1 日發布的部落格文章,講者提到但沒有細講實際做法。
- Braintrust 那篇關於假性經濟的研究,只提到結論,沒有給出細節。
- Kitaru 的 MCP server 能做哪些分析,示範裡只示範了抓紅旗的例子,沒有再展開其他用法。