003 · 讓編碼代理人學會遞迴呼叫自己
講者從 Recursive Language Model 出發,說明如何讓編碼代理人遞迴呼叫自己拆解任務,藉此打造更可靠的工作流程。
原標題:Recursive Coding Agents - Raymond Weitekamp, OpenProse
重點摘要
- 可靠度才是瓶頸講者認為模型已經夠聰明,真正卡住穩定產出成果的,是缺乏規格、管理、重複使用與驗證這一層,不是智慧不夠。
- RLM 把推理與程式執行結合Recursive Language Model 讓 prompt 變成外部檔案,模型用程式碼探索內容,再呼叫其他子模型分工處理拆解出的問題。
- 小模型也能靠 RLM 逆襲在 LongCoT 這類需要維持長串推理的評測上,Qwen 3.5 9B 搭配 RLM 架構的表現超越 Opus 與 GPT-5.4。
- 從 RLM 延伸到遞迴編碼代理人講者做出 pi 的遞迴擴充 Ypi,讓 coding agent harness 可以呼叫一模一樣的自己,深度可自訂。
- OpenProse 讓任何 agent 變 RLMOpenProse 用 Markdown 撰寫,由編碼代理人編譯而非電腦編譯,能替子代理人明確指定要用的技能與工具。
- 把成功的一次操作變成可重複流程講者新增了把 golden session 拆解、轉成可重複執行的 OpenProse 工作流程的功能,目標是讓好結果能重現。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 講者 Raymond Weitekamp 自我介紹,說明要把 RLM(Recursive Language Model)的概念套用到 coding agent 上。 |
| 00:45 | 可靠度是瓶頸 | 模型已經夠聰明,但無法穩定交付結果;講者舉例 Claude Code 曾一次清空他的 Solana 錢包。 |
| 01:59 | 被誤管理的天才 | 引用 MIT 團隊「mismanaged genius」的說法:智慧已經足夠,缺的是規格、管理、重用與驗證。 |
| 02:35 | RLM 的運作方式 | prompt 被外部化成檔案,模型用程式碼探索內容,並呼叫子模型處理拆解出的子問題。 |
| 05:20 | 三個能力展示 | RLM 能處理遠超 context window 的資料量、能當成頂尖記憶系統,也能在長推理任務拿到 SOTA。 |
| 06:46 | 小模型逆襲 | Qwen 3.5 9B 搭配 RLM 架構,在 LongCoT 這類長推理評測上贏過 Opus 與 GPT-5.4。 |
| 07:06 | ARC-AGI-3 爭議 | Symbolica 團隊用 RLM harness 拿下遠高於其他前沿模型的分數,主辦方卻不領情。 |
| 09:02 | RLM 的判準 | 講者提出四個條件:可執行環境、prompt 外部化、模型自行決定拆解方式、狀態維持符號化。 |
| 11:56 | 打造遞迴編碼代理人 | 講者做出 Ypi 與 pi 的遞迴擴充,讓 coding agent harness 可以呼叫一模一樣的自己。 |
| 13:36 | 其他相關專案 | 介紹 DSPy 的 rlm 實作、TypeScript 陣營的 Ax,以及用純 bash 打造的 Unix RLM。 |
| 15:25 | Claude Code 算 RLM 嗎 | 隨著 dynamic workflows 推出,講者認為 Claude Code 現在已經可以算是一種 RLM。 |
| 17:09 | OpenProse 登場 | OpenProse 是用 Markdown 寫的語言,由編碼代理人而非電腦編譯,能把任何有檔案系統與子代理人的 agent 變成 RLM。 |
| 18:35 | 宣告技能與工具依賴 | OpenProse 可以替子代理人明確指定要用的 CLI 工具與技能,確保工作分派時配置正確。 |
| 20:51 | 重現黃金流程 | 新功能能把一次成功的 session 拆解、轉成可重複執行的 OpenProse 工作流程。 |
| 22:09 | 結語 | 講者主張下一步不是提升智慧而是強化行為與 orchestration,並重申 coding agent 不會自動變成 RLM。 |
值得記的話
名詞與人物
| RLM(Recursive Language Model) | 把 prompt 外部化成可用程式碼探索的變數,還能呼叫子模型分工處理,這場演講的核心概念。 |
|---|---|
| OpenProse | 用 Markdown 撰寫、由編碼代理人編譯而非電腦編譯的語言,能把任何有檔案系統與子代理人的 agent 變成 RLM。 |
| pi | Mario Zechner 打造的極簡編碼代理人 harness,設計成用擴充套件加功能,而非塞進核心。 |
| Ypi | 講者做的實驗性封裝,把 Y combinator 的遞迴概念套進 pi,讓 harness 可以呼叫一模一樣的自己。 |
| DSPy | Stanford 的宣告式 LM 程式框架,原始 RLM 論文的 rlm 實作即建在其上。 |
| Ax | TypeScript 陣營的 DSPy 變體,支援讓一個 agent 直接寫出呼叫另一個 agent 的介面,可以遞迴到底。 |
| ARC-AGI-3 | Arc Prize 團隊主辦的推理評測,Symbolica 團隊用 RLM harness 拿下遠高於其他前沿模型的分數。 |
| Dynamic workflows | Claude Code 近期推出的功能,讓 Claude Code 也具備類似 RLM 的動態工作流程能力。 |
延伸
- 講者提到自己有一份放實驗與 rubric 的 GitHub repo,方便對照這場提到的各種嘗試,但沒有在投影片上展開細節。
- 講者提到自己在 Turing Post 寫過關於 RLM 的文章,只提到存在,沒有進一步說明內容。
- 講者提到一個叫做 Lambda RLM 的專案,用 lambda calculus 把問題拆成 map reduce,但因為拆解方式是寫死的,他不把它算進真正的 RLM,沒有再細講實作。