全部場數

011 · 從交易桌到臨床試驗的 AI 心法

講者對照避險基金與製藥新創導入 AI 代理人的經驗,整理出建置垂直 AI 的共通步驟,說明兩個產業最後都得靠領域專家把關。

2026-08-1920:01Ayush Bhardwaj(Allos AI)醫療創業看原片

原標題:Trading Desks to Clinical Trials: Parallels in Applied Vertical AI — Ayush Bhardwaj, Allos AI

重點摘要

  • 提出 Applied Vertical AI 概念泛用 AI(如 Google Translate)服務多個產業;Applied Vertical AI 只鎖定單一產業,目標是模擬該產業從業者的判斷,講者任職的 Allos AI 用 AI 做藥物研發即是一例。
  • 速度與精準的取捨不同,工作核心卻一樣避險基金追求速度,「大致對、快很多」就好;製藥要求絕對正確,寧可多花時間。講者原以為換產業會徹底不同,結果 Applied AI 的核心工作完全沒變。
  • 兩個產業的關鍵資料都被揭露規則逼出來,卻常被隱瞞管理逾一億美元美股部位的機構每季須公開持倉,一旦揭露就被人反向推算、侵蝕獲利;法規也要求揭露每筆臨床試驗成敗,但講者說近三成基金從未照做,FDA 曾公開提醒逾兩千家申辦者未揭露不利結果。這類資料因此連 OpenAI、Anthropic 都拿不到。
  • 模型在這些領域無法自我驗證可驗證獎勵的強化學習在數學、程式這類有標準答案的任務上有效,但交易判斷或藥物候選沒有客觀對錯,用 LLM 當裁判行不通,講者形容那只是「用行話唬弄過去」。
  • 解法是雇用領域專家、建立學習迴圈專家從最基礎的提示詞開始參與,教模型判斷哪些資料來源可靠、如何拆解問題,再透過監督式微調、RLHF、「rubrics as reward」與成本最低、報酬最高的錯誤分析,把專家的判斷逐步內化進代理人。
  • 兩個產業現在都是 AI in the loop,不是 human in the loop最終決策仍由專家拍板,AI 只負責省時間——交易員從候選交易論點中挑一個,藥廠專家從候選藥物中挑一個。講者認為模型與基礎設施都是人人買得到的商品,真正的護城河是網路上找不到的專屬領域資料。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Ayush Bhardwaj 曾在避險基金做 applied AI,現任 Allos AI(製藥新創)技術負責人,自創「Applied Vertical AI」一詞,本場要整理兩個產業建置 AI 代理人的共通步驟。
01:16定義核心概念泛用 AI(如 Google Translate)服務多產業;Applied Vertical AI 只鎖定單一產業,模擬該產業從業者的判斷,Allos AI 做藥物研發即是一例。
02:03產業步調對比避險基金追求速度,「大致對、快很多」即可;製藥要求絕對正確,寧可多花時間。原以為換產業會徹底不同,結果 Applied AI 的核心工作完全沒變。
03:47步驟一:收斂問題建置代理人第一步是把任務收得很窄,不要一次要求做太多事;以選股為例,要指定市場、產業與排序依據,而不是籠統問「幫我找投資機會」。
05:06步驟二:找專屬資料公開資料(新聞、賣方報告、預印本)人人都有,真正拉開差距的是專屬資料,例如避險基金的交易論點紀錄、製藥業失敗實驗的資料,這些通常得自己整理。
07:35迭代卡關講者坦言自己不是交易員、也沒有生醫博士學位,常看不懂模型輸出對不對;他認為許多垂直 AI 專案就是在這一步悄悄失敗,因為外表看似做出來了,實際上沒人會買單。
09:14LLM 當裁判行不通用 LLM 判斷另一個模型輸出好壞走不通,因為 LLM 只是在預測下個字;這類任務沒有像數學、程式那樣的可驗證獎勵,人類卻能立刻分辨對錯。
10:12資料揭露悖論持有逾一億美元美股部位的機構每季須公開持倉,一旦公開就被反向推算、侵蝕獲利;法規也要求揭露每筆臨床試驗成敗,但近三成基金從未照做,FDA 曾公開提醒逾兩千家申辦者未揭露不利結果。
11:45雇用領域專家唯一解法是直接雇用要賣產品給的那個人;避險基金端本來就是老闆兼交易員,製藥新創則得另外找生醫科學家加入團隊,找到人之後產品才開始真正打動大藥廠。
14:07內化判斷的技術把專家判斷內化進代理人有四種做法:監督式微調、RLHF、「rubrics as reward」(AI 依人訂的評分規則自評,有陷入迴音室的風險)、以及成本最低、報酬最高的錯誤分析。
17:48結論:AITL 與護城河兩個產業現在都是 AI in the loop、不是 human in the loop:最終判斷仍在專家身上,AI 只負責省時間。模型與基礎設施是商品,專屬領域資料才是護城河。

值得記的話

名詞與人物

Applied Vertical AI講者自創詞,指只服務單一產業、模擬該產業從業者判斷的 AI,有別於服務多產業的泛用 AI(如 Google Translate)。
Allos AI講者現職的製藥科技新創,用 AI 做藥物研發。
RLVR(reinforcement learning via verifiable rewards)用可驗證答案訓練的強化學習,數學、程式適用,因為對錯可被驗證;金融、醫藥這類判斷型任務難以套用。
LLM as judge用另一個 LLM 評分模型輸出好壞的做法,講者認為在缺乏可驗證對錯的領域行不通。
rubrics as reward講者自稱的做法:由人訂評分規則,讓 AI 依規則自評並改進,等於他版本的「用 AI 回饋做強化學習」,風險是可能陷入自我迴圈。
AITL(AI in the loop)講者提出、對照 human in the loop(HITL)的說法:最終判斷仍由領域專家拍板,AI 只負責節省時間。
Yann LeCun講者兩次引用的 AI 研究者,用他「這些是統計、不是真正的 world model」的說法,支持自己「這類領域無法整體建模、誤差會一路累積」的論點。

延伸

  • 講者提到監督式微調、RLHF、rubrics as reward、錯誤分析這四種做法「每一種都可以獨立講一小時」,受限於時間只能快速帶過,細節沒有展開。
  • 提到模型更新速度快(例如 GLM 5.2、Alibaba Cloud、DeepSeek 相繼推出新版),是 RLHF 維護成本居高不下的原因,但沒有進一步說明。
  • 提到機構每季須公開逾一億美元美股部位、藥廠須揭露臨床試驗成敗的規定與規避情形,但沒有點名具體法規條文或說明後續裁罰。