068 · 階層式拆解如何生出研究假設
Radicait 工程師講如何用階層式拆解問題,讓 coding agent 在醫學影像研究中生出人類等級的假設。
原標題:Autonomous Agents for Scientific Tasks - Sina Shahandeh, Radicait
重點摘要
- 假設比執行更關鍵AI agent 已經很擅長把程式碼寫出來、把實驗跑完,但真正卡住的地方是想不出新的好點子,這正是人類科學家還贏過 agent 的地方。
- CT 轉 PET 的實例Radicait 想用 CT 影像直接生成對應的 PET 影像,省下又貴又耗時的 PET 掃描流程,這也是整場的示範案例。
- 拆解成階層才逼得出激進想法把問題明確拆成架構、訓練損失、指標、資料前處理等元件,並要求 agent 針對每個元件想辦法,才會冒出像換成 3D 卷積這種原本想不到的改動。
- 用另一個模型互相檢查講者會找多模態能力更好的模型檢查影像是否對齊,再用 GPT-5.5 Pro 這類推理能力更強的模型產生假設與批評,讓迴圈品質變好。
- 觀察力才是科學的下一個瓶頸實作能力已經算是相對成熟的部分,真正欠缺的是模型能不能像訓練有素的科學家一樣,看懂科學影像裡的細微異常。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場與主題 | Sina Shahandeh 說明這場要談 Radicait 如何讓 agent 自主執行科學任務。 |
| 00:18 | 陷入飽和瓶頸 | Andrej Karpathy 的 auto-research repo 靠 coding agent 對某個 metrics 做 hill climb,但問題一複雜就會碰到瓶頸。 |
| 01:56 | 假設是關鍵差異 | AI agent 擅長執行,人類能持續進步的關鍵在於不斷提出好假設。 |
| 02:52 | CT 生成 PET 案例 | Radicait 想用 CT 影像直接生成對應的 PET 影像,省去耗時又難做的 PET 掃描流程。 |
| 04:05 | 拆解聚焦子任務 | 把整個研究問題拆成多個步驟,先聚焦在訓練一個 CT 轉 PET 的模型。 |
| 05:14 | Codex 迭代碰壁 | Codex 反覆優化時會走進死路,改善一段時間就會飽和,需要真正的好點子才能突破。 |
| 06:45 | 誘發激進構想 | 把問題明確拆成子元件、要求 agent 去找靈感,才能逼出像 3D 卷積這種根本性的改動。 |
| 07:43 | 生成階層文件 | coding agent 能照元件階層,自動生成一系列互相連結的說明文件,方便釐清問題結構。 |
| 10:02 | 階層結構見突破 | 有完整的元件階層後,agent 能一次生成上百種修改方案,找到原本想不到的 3D 改法。 |
| 12:07 | 案例二:影像對位 | 另一個例子是把 CT 與 PET 掃描對齊,同樣要靠持續優化的迴圈,還牽涉不少質性指標。 |
| 14:21 | 多模態模型把關 | 找另一個多模態能力更強的模型檢查影像是否對齊、遮罩是否正確,取代人工逐張檢查。 |
| 15:42 | 引入更強推理模型 | 透過 Peter Steinberger 的 Oracle CLI 把程式碼與資料送進 GPT-5.5 Pro,讓它生成假設並評論實作成效。 |
| 16:44 | 回到自主研究者 | 實作能力已經相對成熟,真正的瓶頸在於模型對科學影像的觀察與理解能力不足。 |
| 18:00 | 技巧終將被取代 | 這套手動拆解階層的技巧,隨模型的推理與拆解能力進步,未來需求會愈來愈少。 |
值得記的話
名詞與人物
| Radicait | 講者任職的公司,這場的醫學影像案例都來自這裡。 |
|---|---|
| Andrej Karpathy | 開場提到的 auto-research repo 作者,示範用 coding agent 對 metrics 做 hill climb 優化。 |
| Codex | 講者用來跑自主優化迴圈、產生階層文件的 coding agent。 |
| GAN | 把 CT 影像轉成 PET 影像所用的一種生成模型架構,由編碼器與解碼器組成。 |
| image registration | 把兩次不同時間、不同掃描器拍攝的影像(如 CT 與 PET)對齊校準的流程。 |
| Obsidian | 講者用來展示元件階層文件關聯圖的筆記軟體。 |
| Oracle CLI | Peter Steinberger 開發的工具,能把程式碼與資料打包送進 GPT-5.5 Pro 的 API。 |
| GPT-5.5 Pro | 講者用來生成假設、評論實作成效的模型,測試時運算量較大。 |
延伸
- 講者提到用 Gemini 模型建立影像複核的技能,但沒有說明實際的提示詞或設定方式。
- 講者認為把多模態模型針對科學影像與資料做微調還有很大空間,但沒有進一步說明具體做法。
- 講者提到同樣的階層拆解技巧曾用在 GPT-4.0 這類基礎模型上來加強推理,但沒有細講差異。