011 · 從交易桌到臨床試驗的 AI 心法
講者對照避險基金與製藥新創導入 AI 代理人的經驗,整理出建置垂直 AI 的共通步驟,說明兩個產業最後都得靠領域專家把關。
原標題:Trading Desks to Clinical Trials: Parallels in Applied Vertical AI — Ayush Bhardwaj, Allos AI
重點摘要
- 提出 Applied Vertical AI 概念泛用 AI(如 Google Translate)服務多個產業;Applied Vertical AI 只鎖定單一產業,目標是模擬該產業從業者的判斷,講者任職的 Allos AI 用 AI 做藥物研發即是一例。
- 速度與精準的取捨不同,工作核心卻一樣避險基金追求速度,「大致對、快很多」就好;製藥要求絕對正確,寧可多花時間。講者原以為換產業會徹底不同,結果 Applied AI 的核心工作完全沒變。
- 兩個產業的關鍵資料都被揭露規則逼出來,卻常被隱瞞管理逾一億美元美股部位的機構每季須公開持倉,一旦揭露就被人反向推算、侵蝕獲利;法規也要求揭露每筆臨床試驗成敗,但講者說近三成基金從未照做,FDA 曾公開提醒逾兩千家申辦者未揭露不利結果。這類資料因此連 OpenAI、Anthropic 都拿不到。
- 模型在這些領域無法自我驗證可驗證獎勵的強化學習在數學、程式這類有標準答案的任務上有效,但交易判斷或藥物候選沒有客觀對錯,用 LLM 當裁判行不通,講者形容那只是「用行話唬弄過去」。
- 解法是雇用領域專家、建立學習迴圈專家從最基礎的提示詞開始參與,教模型判斷哪些資料來源可靠、如何拆解問題,再透過監督式微調、RLHF、「rubrics as reward」與成本最低、報酬最高的錯誤分析,把專家的判斷逐步內化進代理人。
- 兩個產業現在都是 AI in the loop,不是 human in the loop最終決策仍由專家拍板,AI 只負責省時間——交易員從候選交易論點中挑一個,藥廠專家從候選藥物中挑一個。講者認為模型與基礎設施都是人人買得到的商品,真正的護城河是網路上找不到的專屬領域資料。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | Ayush Bhardwaj 曾在避險基金做 applied AI,現任 Allos AI(製藥新創)技術負責人,自創「Applied Vertical AI」一詞,本場要整理兩個產業建置 AI 代理人的共通步驟。 |
| 01:16 | 定義核心概念 | 泛用 AI(如 Google Translate)服務多產業;Applied Vertical AI 只鎖定單一產業,模擬該產業從業者的判斷,Allos AI 做藥物研發即是一例。 |
| 02:03 | 產業步調對比 | 避險基金追求速度,「大致對、快很多」即可;製藥要求絕對正確,寧可多花時間。原以為換產業會徹底不同,結果 Applied AI 的核心工作完全沒變。 |
| 03:47 | 步驟一:收斂問題 | 建置代理人第一步是把任務收得很窄,不要一次要求做太多事;以選股為例,要指定市場、產業與排序依據,而不是籠統問「幫我找投資機會」。 |
| 05:06 | 步驟二:找專屬資料 | 公開資料(新聞、賣方報告、預印本)人人都有,真正拉開差距的是專屬資料,例如避險基金的交易論點紀錄、製藥業失敗實驗的資料,這些通常得自己整理。 |
| 07:35 | 迭代卡關 | 講者坦言自己不是交易員、也沒有生醫博士學位,常看不懂模型輸出對不對;他認為許多垂直 AI 專案就是在這一步悄悄失敗,因為外表看似做出來了,實際上沒人會買單。 |
| 09:14 | LLM 當裁判行不通 | 用 LLM 判斷另一個模型輸出好壞走不通,因為 LLM 只是在預測下個字;這類任務沒有像數學、程式那樣的可驗證獎勵,人類卻能立刻分辨對錯。 |
| 10:12 | 資料揭露悖論 | 持有逾一億美元美股部位的機構每季須公開持倉,一旦公開就被反向推算、侵蝕獲利;法規也要求揭露每筆臨床試驗成敗,但近三成基金從未照做,FDA 曾公開提醒逾兩千家申辦者未揭露不利結果。 |
| 11:45 | 雇用領域專家 | 唯一解法是直接雇用要賣產品給的那個人;避險基金端本來就是老闆兼交易員,製藥新創則得另外找生醫科學家加入團隊,找到人之後產品才開始真正打動大藥廠。 |
| 14:07 | 內化判斷的技術 | 把專家判斷內化進代理人有四種做法:監督式微調、RLHF、「rubrics as reward」(AI 依人訂的評分規則自評,有陷入迴音室的風險)、以及成本最低、報酬最高的錯誤分析。 |
| 17:48 | 結論:AITL 與護城河 | 兩個產業現在都是 AI in the loop、不是 human in the loop:最終判斷仍在專家身上,AI 只負責省時間。模型與基礎設施是商品,專屬領域資料才是護城河。 |
值得記的話
名詞與人物
| Applied Vertical AI | 講者自創詞,指只服務單一產業、模擬該產業從業者判斷的 AI,有別於服務多產業的泛用 AI(如 Google Translate)。 |
|---|---|
| Allos AI | 講者現職的製藥科技新創,用 AI 做藥物研發。 |
| RLVR(reinforcement learning via verifiable rewards) | 用可驗證答案訓練的強化學習,數學、程式適用,因為對錯可被驗證;金融、醫藥這類判斷型任務難以套用。 |
| LLM as judge | 用另一個 LLM 評分模型輸出好壞的做法,講者認為在缺乏可驗證對錯的領域行不通。 |
| rubrics as reward | 講者自稱的做法:由人訂評分規則,讓 AI 依規則自評並改進,等於他版本的「用 AI 回饋做強化學習」,風險是可能陷入自我迴圈。 |
| AITL(AI in the loop) | 講者提出、對照 human in the loop(HITL)的說法:最終判斷仍由領域專家拍板,AI 只負責節省時間。 |
| Yann LeCun | 講者兩次引用的 AI 研究者,用他「這些是統計、不是真正的 world model」的說法,支持自己「這類領域無法整體建模、誤差會一路累積」的論點。 |
延伸
- 講者提到監督式微調、RLHF、rubrics as reward、錯誤分析這四種做法「每一種都可以獨立講一小時」,受限於時間只能快速帶過,細節沒有展開。
- 提到模型更新速度快(例如 GLM 5.2、Alibaba Cloud、DeepSeek 相繼推出新版),是 RLHF 維護成本居高不下的原因,但沒有進一步說明。
- 提到機構每季須公開逾一億美元美股部位、藥廠須揭露臨床試驗成敗的規定與規避情形,但沒有點名具體法規條文或說明後續裁罰。