063 · Agent 何時才算真正完成
這場拆解「完成」背後藏著的多重營運主張,說明 Paperclip 如何用 liveness 模型,在讓 agent 持續推進與確保品質之間抓平衡。
原標題:What Does Done Even Mean? Agents and Paperclip's Liveness Model - Dotta, Paperclip
重點摘要
- 綠色勾選蓋不住差異agent 開 PR、過測試、關 issue 看起來像做完了,但「能合併」「能部署」「能對客戶宣布」其實是完全不同層級的主張,多數系統卻把它們壓成同一個勾選。
- 人力查核跟不上產出agent 產出程式與文件的速度已經超過人力所能驗證的量,這反而變成一種新的失效模式:agent 製造出來的工作量比人有時間查核的還多。
- 完成要有實質內容真正的「完成」不只是狀態被改成 done,而是要有可驗證的成果、對照的標準、證據,還要清楚知道下一步該交給誰。
- 全靠人審會卡死,全無審核會變質任務全部靠人力簽核,正確性有保障但流程會卡住不動,甚至流於形式;完全沒有審核則會失去品質控管,長遠來看比什麼都不做還糟。
- liveness 與驗證要抓平衡Paperclip 設下三條底線,確保工作持續推進、只有真正的阻礙才能擋下工作、迴圈必須有界,並用明確的 blocker、reviewer/approver 設定與 watchdog 機制去落實。
- 把完成當物件而不是布林值完成應該拆成成果、範圍、標準、證據、簽核者、風險與下一步這幾件事,分開定義,而不是一個開關。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場情境 | Agent 開 PR、過測試、更新文件、關 issue,看起來像做完了,但這樣算不算真的「完成」,是這場要拆解的問題。 |
| 00:15 | 講者與命題 | Dotta(Paperclip 創辦人)指出,多數 agent 系統把「能合併」「能部署」「能宣布」這些不同層級的主張,通通壓成同一個綠色勾選。 |
| 00:34 | 問題所在 | agent 產出程式與文件的速度已超過人力查核的量,這變成一種新的失效模式:產出的工作比人有時間驗證的還多。 |
| 00:50 | 完成的定義 | 「完成」不是狀態被改成 done,而是要有可驗證的成果、對照的標準、證據,並清楚知道下一步的負責人是誰。 |
| 02:00 | 人力把關的極限 | 當所有任務都要靠人力簽核,數量一多就會流於形式,變成講者所說的「驗證劇場」,而不是真正的品質把關。 |
| 02:40 | 進度與正確性的拉鋸 | 人工審核能確保正確,卻也讓任務卡住不動;Paperclip 想在「持續有進度」與「確保被驗證」之間抓平衡。 |
| 04:05 | 三個不變量 | Paperclip 對代理工作流設下三條底線:工作要持續推進、只有真正的 blocker 能擋下工作、迴圈必須有界,不能無限循環。 |
| 04:39 | Watchdog | watchdog 是一種被賦予目標的 maximizer 代理人,負責督促所有 agent 做到目標達成為止,且不綁定特定 harness,可跨 Pi、OpenClaw、Hermes、Claude Code、Codex 使用。 |
| 05:59 | 團隊實作建議 | 講者建議把驗證者跟作者分開(通常換一個不同的模型)、要求 agent 提供具體證據而不是只回答「做完了嗎」,並讓每個 agent 都清楚工作要交給誰。 |
值得記的話
名詞與人物
| Dotta | Paperclip 的創辦人,這場的講者。 |
|---|---|
| Paperclip | 講者打造的 agent 任務管理系統,核心是判斷任務何時真正完成的 liveness 模型。 |
| liveness | 這場脈絡下指工作能持續往前推進、不被卡住的狀態,要跟人工驗證的正確性互相平衡。 |
| watchdog | Paperclip 裡的一種 maximizer 代理人,被賦予目標後會持續督促其他 agent 完成,且不綁定特定 harness。 |
| verification theater | 講者用來形容人力簽核多到流於形式、無法真正把關的狀態。 |
| chain of custody | 講者強調每個 agent 做完工作後要清楚知道下一步交給誰,形成可追蹤的責任鏈。 |
延伸
- Pi、Hermes 等其他 agent harness:只被點名是 watchdog 相容的例子,沒有進一步說明各自差異。
- task dependency tree、idempotent checkout 等控制平面細節:提到會讓 liveness 與驗證變複雜,但沒有展開實作方式。
- 驗證者該換哪個模型:提到驗證者通常會換成不同的模型,但沒有說明怎麼挑選。