全部場數

003 · 讓編碼代理人學會遞迴呼叫自己

講者從 Recursive Language Model 出發,說明如何讓編碼代理人遞迴呼叫自己拆解任務,藉此打造更可靠的工作流程。

2026-06-2523:48Raymond Weitekamp(OpenProse)Agent開發工具評估模型看原片

原標題:Recursive Coding Agents - Raymond Weitekamp, OpenProse

重點摘要

  • 可靠度才是瓶頸講者認為模型已經夠聰明,真正卡住穩定產出成果的,是缺乏規格、管理、重複使用與驗證這一層,不是智慧不夠。
  • RLM 把推理與程式執行結合Recursive Language Model 讓 prompt 變成外部檔案,模型用程式碼探索內容,再呼叫其他子模型分工處理拆解出的問題。
  • 小模型也能靠 RLM 逆襲在 LongCoT 這類需要維持長串推理的評測上,Qwen 3.5 9B 搭配 RLM 架構的表現超越 Opus 與 GPT-5.4。
  • 從 RLM 延伸到遞迴編碼代理人講者做出 pi 的遞迴擴充 Ypi,讓 coding agent harness 可以呼叫一模一樣的自己,深度可自訂。
  • OpenProse 讓任何 agent 變 RLMOpenProse 用 Markdown 撰寫,由編碼代理人編譯而非電腦編譯,能替子代理人明確指定要用的技能與工具。
  • 把成功的一次操作變成可重複流程講者新增了把 golden session 拆解、轉成可重複執行的 OpenProse 工作流程的功能,目標是讓好結果能重現。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場講者 Raymond Weitekamp 自我介紹,說明要把 RLM(Recursive Language Model)的概念套用到 coding agent 上。
00:45可靠度是瓶頸模型已經夠聰明,但無法穩定交付結果;講者舉例 Claude Code 曾一次清空他的 Solana 錢包。
01:59被誤管理的天才引用 MIT 團隊「mismanaged genius」的說法:智慧已經足夠,缺的是規格、管理、重用與驗證。
02:35RLM 的運作方式prompt 被外部化成檔案,模型用程式碼探索內容,並呼叫子模型處理拆解出的子問題。
05:20三個能力展示RLM 能處理遠超 context window 的資料量、能當成頂尖記憶系統,也能在長推理任務拿到 SOTA。
06:46小模型逆襲Qwen 3.5 9B 搭配 RLM 架構,在 LongCoT 這類長推理評測上贏過 Opus 與 GPT-5.4。
07:06ARC-AGI-3 爭議Symbolica 團隊用 RLM harness 拿下遠高於其他前沿模型的分數,主辦方卻不領情。
09:02RLM 的判準講者提出四個條件:可執行環境、prompt 外部化、模型自行決定拆解方式、狀態維持符號化。
11:56打造遞迴編碼代理人講者做出 Ypi 與 pi 的遞迴擴充,讓 coding agent harness 可以呼叫一模一樣的自己。
13:36其他相關專案介紹 DSPy 的 rlm 實作、TypeScript 陣營的 Ax,以及用純 bash 打造的 Unix RLM。
15:25Claude Code 算 RLM 嗎隨著 dynamic workflows 推出,講者認為 Claude Code 現在已經可以算是一種 RLM。
17:09OpenProse 登場OpenProse 是用 Markdown 寫的語言,由編碼代理人而非電腦編譯,能把任何有檔案系統與子代理人的 agent 變成 RLM。
18:35宣告技能與工具依賴OpenProse 可以替子代理人明確指定要用的 CLI 工具與技能,確保工作分派時配置正確。
20:51重現黃金流程新功能能把一次成功的 session 拆解、轉成可重複執行的 OpenProse 工作流程。
22:09結語講者主張下一步不是提升智慧而是強化行為與 orchestration,並重申 coding agent 不會自動變成 RLM。

值得記的話

名詞與人物

RLM(Recursive Language Model)把 prompt 外部化成可用程式碼探索的變數,還能呼叫子模型分工處理,這場演講的核心概念。
OpenProse用 Markdown 撰寫、由編碼代理人編譯而非電腦編譯的語言,能把任何有檔案系統與子代理人的 agent 變成 RLM。
piMario Zechner 打造的極簡編碼代理人 harness,設計成用擴充套件加功能,而非塞進核心。
Ypi講者做的實驗性封裝,把 Y combinator 的遞迴概念套進 pi,讓 harness 可以呼叫一模一樣的自己。
DSPyStanford 的宣告式 LM 程式框架,原始 RLM 論文的 rlm 實作即建在其上。
AxTypeScript 陣營的 DSPy 變體,支援讓一個 agent 直接寫出呼叫另一個 agent 的介面,可以遞迴到底。
ARC-AGI-3Arc Prize 團隊主辦的推理評測,Symbolica 團隊用 RLM harness 拿下遠高於其他前沿模型的分數。
Dynamic workflowsClaude Code 近期推出的功能,讓 Claude Code 也具備類似 RLM 的動態工作流程能力。

延伸

  • 講者提到自己有一份放實驗與 rubric 的 GitHub repo,方便對照這場提到的各種嘗試,但沒有在投影片上展開細節。
  • 講者提到自己在 Turing Post 寫過關於 RLM 的文章,只提到存在,沒有進一步說明內容。
  • 講者提到一個叫做 Lambda RLM 的專案,用 lambda calculus 把問題拆成 map reduce,但因為拆解方式是寫死的,他不把它算進真正的 RLM,沒有再細講實作。