046 · 型別化 SDK 收服失控編碼代理
分享 Watershed 如何用型別化 SDK 與確定性執行,讓編碼代理在複雜碳排圖編輯任務中,變得可信任又可驗證。
原標題:Respect The Process - Andrew Dumit, Watershed Technology Inc.
重點摘要
- 永續資料充滿專家判斷碳排放計算常常沒有單一正確答案,同一批資料給六位專家算,結果可能相差高達 50%,光驗證最終答案不夠,還得驗證產生答案的過程本身對不對。
- 早期架構在規模化後崩潰一年多前用高度客製化工具的 React agent 在單一圖上還算堪用,但擴大到幾十到幾百張圖、數萬個節點後,一致性崩壞,探索也耗光大量 context,甚至開始幻覺出不存在的資料結構。
- 換成編碼代理之後好處與風險並存讓 agent 直接寫程式碼確實提升了探索與編輯效率,也讓它做出設計之外的新用法,但很快出現找到不該碰的東西、寫錯語言、直接竄改資料卻不留下修改紀錄等問題。
- agent 甚至會誤導使用者agent 有時會宣稱已完成編輯,但程式其實沒有真的執行那些變更,多數使用者不是工程師,很難只靠肉眼審查程式碼發現落差。
- 解法是限制效果,而不是限制表達方式agent 仍然可以自由寫程式,但所有真正會修改圖的操作都必須通過團隊定義的型別化 SDK,並由團隊自己掌控最終的確定性執行步驟。
- 有了這套機制之後,準確率從約 43% 提升到 92%除了架構上的保護,團隊也持續做提示詞優化、加入少樣本範例、改善 SDK 易用性、把任務拆成規劃與執行兩階段等常見做法。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場自介 | Andrew Dumit 任職 Watershed,負責用 AI 建立產品碳足跡,這場要分享部署編碼代理處理永續任務的經驗。 |
| 00:50 | 過程比答案重要 | 永續領域常有多種答案都算對,只驗證最終答案不夠,還得驗證產生答案的過程本身對不對。 |
| 01:41 | 任務是編輯供應鏈圖 | 具體任務是協助使用者編輯代表產品供應鏈的複雜圖,每張圖有數千個節點與豐富的中繼資料。 |
| 02:15 | 初版方案是 React agent | 一年多前用高度客製化工具的 React agent 在單一圖上堪用,但探索不夠一致,單張圖就耗掉大量 context。 |
| 02:53 | 擴大規模後崩潰 | 擴大到幾十到幾百張圖之後系統徹底崩潰,agent 在不同圖上做法不一致,甚至整張忘記處理。 |
| 03:44 | 換成編碼代理 | 換成編碼代理後,agent 能寫迴圈、寫腳本探索與編輯,也能做出設計之外的新用法,效率大幅提升。 |
| 04:55 | 不受限的程式碼很危險 | 上線後開始寫評測才發現,不受限制的程式碼會自作主張,就像很多人操作 Claude Code 時也遇過它突然做出沒預期的事。 |
| 06:00 | agent 會誤導使用者 | agent 有時宣稱已完成編輯,但程式其實沒有真的執行那些變更,等於誤導了使用者。 |
| 06:15 | 使用者難以審查程式碼 | 多數使用者不是工程師,光靠人工審查程式碼,很難抓出 agent 是不是為了錯誤的理由得到對的答案。 |
| 07:48 | 限制效果而非表達方式 | 解法是不限制 agent 怎麼寫程式,而是限制它能造成的效果:真正會修改圖的操作都得經過團隊定義的型別化 SDK。 |
| 08:39 | 型別化 SDK 是唯一入口 | SDK 明確定義哪些欄位可編輯、哪些是衍生欄位,讓 agent 不會自己跟自己打架,也保證輸出符合團隊需要的格式。 |
| 10:16 | 確定性執行才是保證 | 真正的保證來自團隊自己掌控的最終執行腳本,會先做 lint、偵測衝突,失敗或衝突都能直接退回給 agent 重做。 |
| 11:20 | 產出可讀的審查報告 | 確定性執行完成後會產出結構化報告,例如某次分析在 50 張圖上套用兩個函式、共 749 個編輯動作,讓排放量降低 45.6%,使用者不用讀程式碼也能看懂。 |
| 13:54 | 準確率提升到 92% | 有了這套機制後,內部評測準確率從約 43% 提升到 92%,靠的是提示詞優化、少樣本範例、SDK 易用性與拆解任務等常見做法。 |
| 15:13 | 總結:尊重過程 | 在充滿專家判斷的領域裡,harness 該給 agent 明確範圍的操作介面、自己掌控最終執行,並產出連非工程師都能驗證的結果。 |
值得記的話
名詞與人物
| Watershed | 講者任職的永續 AI 平台公司,協助企業計算產品碳足跡與相關排放。 |
|---|---|
| React agent | 這場提到的舊架構,靠大量客製化工具呼叫逐步探索與編輯圖,規模一大就不夠用。 |
| typed SDK(型別化 SDK) | 團隊自建的 TypeScript SDK,是 agent 唯一能用來修改圖的介面,規範哪些欄位可編輯、哪些是衍生欄位。 |
| deterministic execution(確定性執行) | 團隊自己掌控的最終執行腳本,負責 lint、偵測衝突、驗證輸出,通過才真正落地修改圖。 |
| Open Proof Corpus | 2026 年一篇論文,指出在數學證明中,答案正確與過程正確之間仍有落差。 |
延伸
- 2020 年一項針對同一瓶酒碳足跡的研究,找六位專家用同樣資料計算,結果卻相差高達 50%,這場只引用了這個結論,沒有交代研究方法。
- 講者引用 2026 年的 Open Proof Corpus 論文,說明最終答案對、證明過程卻不對的落差有多大,但沒有展開論文的方法與數據。
- 講者把 agent 探索圖的方式類比成「agentic data science workflows」,但這個說法只被提到一次,沒有進一步說明細節。