全部場數

030 · 讓 Agent 自動建、測、修 Agent

Mutagent 兩位創辦人示範怎麼用 agent 接手建 agent、eval、診斷到優化的整套流程。

2026-06-2934:49Benedikt Sanftl(Mutagent)Agent開發工具評估看原片

原標題:The Agentic AI Engineer - Benedikt Sanftl, Mutagent

重點摘要

  • 建 agent 也該走軟體開發的迴圈像寫程式一樣分成 spec、build、eval、ship 幾個階段,上線後再進入 monitor、diagnose、optimize 的迴圈,周而復始。
  • 人工迭代撐不住規模一個個手動看 trace、判斷、修正,agent 一多就變成瓶頸,這正是 agentic AI engineer 想解決的問題。
  • spec 是後續一切的依據把責任範圍、context 需求、要用的工具與邊界寫清楚,換框架、換 harness 都不必重新設計一次。
  • eval 要能告訴你怎麼修比起模糊的評分制,binary 判準更容易指出哪裡壞了;用 LLM 當裁判時,還要處理評分不穩定的問題。
  • 診斷靠抽樣不是逐條看把驗證過的失敗模式變成可以直接比對的訊號,之後不必每次都重讀全部 trace。
  • Mutagent 把這套流程做成產品evaluator agent 負責建資料集,diagnostics agent 負責找上線後的根因,兩者由一個跑在 coding 環境裡的 orchestrator 串起來。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Bene 與 Burak 開場,說明這場要講 agentic AI engineer 怎麼運作。
00:35兩個迴圈建 agent 分成上線前的 offline loop(迭代、測試、evaluate)與上線後的 online loop(監控、診斷、回饋)。
01:08手動迭代的瓶頸目前多半靠人工跑這個迴圈,人力審核與建置時間跟不上規模,尤其是要一次推出上百個 agent 的時候。
03:08迴圈七階段spec、build、eval、ship 到 monitor、diagnose、optimize,整套流程都可以逐步交給 agent 執行。
05:50兩種起點從零開始建 agent,跟改既有已上線的 agent,該走的路不一樣。
07:03spec 先定邊界spec 要寫清楚 context 需求、要用的工具,以及 agent 該做與不該做的事,成為之後開發的依據。
08:44build 交給 coding agent把 spec 交給 coding agent 落地,目標平台可以自己選,框架保留彈性方便日後更換。
11:10eval suite 怎麼長出來eval 由 metrics、criteria 加資料集組成,很難一開始就寫齊,得靠正式上線後持續補齊邊界案例。
13:43為何要 evaluator agent光是一份 200 筆的資料集,沒有自動化的 eval,靠人眼一筆一筆看就要花很久,人力變成瓶頸。
15:19好 eval 要看什麼要看 agent 拿到的 context 完不完整,也要檢查過程中每一步工具輸出對不對,而不是只看最終結果。
17:15二元判準比較好用模糊的評分制不容易告訴你該怎麼修,binary 判準更直接;用 LLM 當裁判還要處理評分不穩定的問題。
18:47上線後找根因蒐集失敗案例並依根因分類,再把驗證過的失敗模式變成可以直接比對的訊號,省去每次重讀全部 trace 的成本。
22:04自動優化與部署依 eval 分數調整 agent 的內容,分數達標就自動上線,形成完整的自動迴圈。
24:55Mutagent 的兩隻 agentevaluator agent 負責建資料集,diagnostics agent 負責找上線後的問題,由一個跑在 coding 環境裡的 orchestrator 串起來。
27:05現場示範在 Claude Code 裡下診斷指令,產出的 HTML 報告列出失敗模式、根因鏈與修復建議,最後轉成給 coding agent 的任務清單。
34:15結語呼籲別再手動除錯,讓 agent 分攤重複瑣碎的工作。

值得記的話

名詞與人物

Mutagent這場演講兩位講者所屬的新創公司,做的產品是把建 agent 的流程 agent 化的平台。
BeneMutagent 的 CEO 兼共同創辦人,這場開場與整體流程說明由他主講。
BurakMutagent 的 CTO,負責深入講解各階段細節,也負責現場示範。
offline loop上線前的開發迭代:建 agent、測試、evaluate、改善。
online loop上線後持續監控 trace、診斷問題,再把結果回饋進優化。
evaluator agentMutagent 目前研究預覽中的兩隻 agent 之一,協助建立 eval 資料集。
diagnostics agentMutagent 另一隻研究預覽中的 agent,協助分析上線後的 trace、找出根因。
orchestrator串接 evaluator agent 與 diagnostics agent 的角色,跑在使用者自己的 coding 環境裡。
trajectoryagent 從收到任務到產出結果的完整執行過程,是評測時要看的核心對象。

延伸

  • 提到修復結果可以自動變成 GitHub 上的 PR、直接調整 agent 的 MD 設定檔,或部署到代管服務,但沒有進一步說明每種輸出方式的細節。
  • 提到可以用語音輸入(speech-to-text)在報告裡留一般性回饋,但只是順帶一提,沒有展開。
  • 提到近來不斷有新的 agent runtime、harness 冒出來,但沒有點名細節。