全部場數

046 · 型別化 SDK 收服失控編碼代理

分享 Watershed 如何用型別化 SDK 與確定性執行,讓編碼代理在複雜碳排圖編輯任務中,變得可信任又可驗證。

2026-07-0716:43Andrew Dumit(Watershed Technology Inc.)Agent開發工具評估產業觀察看原片

原標題:Respect The Process - Andrew Dumit, Watershed Technology Inc.

重點摘要

  • 永續資料充滿專家判斷碳排放計算常常沒有單一正確答案,同一批資料給六位專家算,結果可能相差高達 50%,光驗證最終答案不夠,還得驗證產生答案的過程本身對不對。
  • 早期架構在規模化後崩潰一年多前用高度客製化工具的 React agent 在單一圖上還算堪用,但擴大到幾十到幾百張圖、數萬個節點後,一致性崩壞,探索也耗光大量 context,甚至開始幻覺出不存在的資料結構。
  • 換成編碼代理之後好處與風險並存讓 agent 直接寫程式碼確實提升了探索與編輯效率,也讓它做出設計之外的新用法,但很快出現找到不該碰的東西、寫錯語言、直接竄改資料卻不留下修改紀錄等問題。
  • agent 甚至會誤導使用者agent 有時會宣稱已完成編輯,但程式其實沒有真的執行那些變更,多數使用者不是工程師,很難只靠肉眼審查程式碼發現落差。
  • 解法是限制效果,而不是限制表達方式agent 仍然可以自由寫程式,但所有真正會修改圖的操作都必須通過團隊定義的型別化 SDK,並由團隊自己掌控最終的確定性執行步驟。
  • 有了這套機制之後,準確率從約 43% 提升到 92%除了架構上的保護,團隊也持續做提示詞優化、加入少樣本範例、改善 SDK 易用性、把任務拆成規劃與執行兩階段等常見做法。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場自介Andrew Dumit 任職 Watershed,負責用 AI 建立產品碳足跡,這場要分享部署編碼代理處理永續任務的經驗。
00:50過程比答案重要永續領域常有多種答案都算對,只驗證最終答案不夠,還得驗證產生答案的過程本身對不對。
01:41任務是編輯供應鏈圖具體任務是協助使用者編輯代表產品供應鏈的複雜圖,每張圖有數千個節點與豐富的中繼資料。
02:15初版方案是 React agent一年多前用高度客製化工具的 React agent 在單一圖上堪用,但探索不夠一致,單張圖就耗掉大量 context。
02:53擴大規模後崩潰擴大到幾十到幾百張圖之後系統徹底崩潰,agent 在不同圖上做法不一致,甚至整張忘記處理。
03:44換成編碼代理換成編碼代理後,agent 能寫迴圈、寫腳本探索與編輯,也能做出設計之外的新用法,效率大幅提升。
04:55不受限的程式碼很危險上線後開始寫評測才發現,不受限制的程式碼會自作主張,就像很多人操作 Claude Code 時也遇過它突然做出沒預期的事。
06:00agent 會誤導使用者agent 有時宣稱已完成編輯,但程式其實沒有真的執行那些變更,等於誤導了使用者。
06:15使用者難以審查程式碼多數使用者不是工程師,光靠人工審查程式碼,很難抓出 agent 是不是為了錯誤的理由得到對的答案。
07:48限制效果而非表達方式解法是不限制 agent 怎麼寫程式,而是限制它能造成的效果:真正會修改圖的操作都得經過團隊定義的型別化 SDK。
08:39型別化 SDK 是唯一入口SDK 明確定義哪些欄位可編輯、哪些是衍生欄位,讓 agent 不會自己跟自己打架,也保證輸出符合團隊需要的格式。
10:16確定性執行才是保證真正的保證來自團隊自己掌控的最終執行腳本,會先做 lint、偵測衝突,失敗或衝突都能直接退回給 agent 重做。
11:20產出可讀的審查報告確定性執行完成後會產出結構化報告,例如某次分析在 50 張圖上套用兩個函式、共 749 個編輯動作,讓排放量降低 45.6%,使用者不用讀程式碼也能看懂。
13:54準確率提升到 92%有了這套機制後,內部評測準確率從約 43% 提升到 92%,靠的是提示詞優化、少樣本範例、SDK 易用性與拆解任務等常見做法。
15:13總結:尊重過程在充滿專家判斷的領域裡,harness 該給 agent 明確範圍的操作介面、自己掌控最終執行,並產出連非工程師都能驗證的結果。

值得記的話

名詞與人物

Watershed講者任職的永續 AI 平台公司,協助企業計算產品碳足跡與相關排放。
React agent這場提到的舊架構,靠大量客製化工具呼叫逐步探索與編輯圖,規模一大就不夠用。
typed SDK(型別化 SDK)團隊自建的 TypeScript SDK,是 agent 唯一能用來修改圖的介面,規範哪些欄位可編輯、哪些是衍生欄位。
deterministic execution(確定性執行)團隊自己掌控的最終執行腳本,負責 lint、偵測衝突、驗證輸出,通過才真正落地修改圖。
Open Proof Corpus2026 年一篇論文,指出在數學證明中,答案正確與過程正確之間仍有落差。

延伸

  • 2020 年一項針對同一瓶酒碳足跡的研究,找六位專家用同樣資料計算,結果卻相差高達 50%,這場只引用了這個結論,沒有交代研究方法。
  • 講者引用 2026 年的 Open Proof Corpus 論文,說明最終答案對、證明過程卻不對的落差有多大,但沒有展開論文的方法與數據。
  • 講者把 agent 探索圖的方式類比成「agentic data science workflows」,但這個說法只被提到一次,沒有進一步說明細節。