076 · 單細胞基礎模型的資料難題
講者從單細胞生物學出發,說明現有基礎模型如何處理基因表現資料,並指出資料異質性為何限制模型表現。
原標題:From Tokens to Cells: Foundation Models for Single-Cell Biology - Akram Baharlouei, Altos Labs
重點摘要
- Yamanaka factor 的啟發2006 年 Shinya Yamanaka 發現四個轉錄因子,能把老化的皮膚細胞重編程回胚胎幹細胞狀態,這項發現後來拿下 2012 年諾貝爾獎,也帶出部分重編程與抗老應用的想像空間。
- 單細胞研究的終極目標講者說明研究單細胞是為了由下而上建立細胞、組織、器官乃至整個人體的模型,目前已有計畫在繪製人體內每一顆細胞,最終希望走向 virtual cell、virtual tissue 這類數位分身。
- 藥物開發的效率困境運算力持續依摩爾定律成長,但每年上市的新藥數量卻在下滑,一款藥物從研發到臨床可能耗時 10 年、花費數十億美元,AI 的目標是縮短整條研發管線,而不只是某一段。
- 量測單細胞的四種模態基因體序列在所有細胞裡幾乎相同,RNA 序列反映基因表現量、資料量最大也最常拿來訓練基礎模型,蛋白質體最貼近細胞功能卻難以量測,型態學則能看出細胞在組織裡的位置。
- 資料異質性是核心難題即使量測兩顆完全相同的細胞,讀數也不會一樣,原因一部分是細胞變化本身是跳躍式而非連續、量測到的只是某個瞬間的快照,一部分是不同實驗室、不同機台造成的技術性差異。
- 兩類基礎模型的表現落差把細胞當句子、基因當 token 的 BERT 式 transformer 模型,會把資料壓縮成潛在向量,卻因此流失大量資訊,讓簡單線性模型有時表現得一樣好甚至更好;從高斯雜訊出發、直接比對分布的流動匹配模型目前表現較佳。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | Akram Baharlouei 自我介紹是 Altos Labs 的機器學習工程師,公司目標是透過細胞回春逆轉老化相關疾病,這場要從工程角度談單細胞基礎模型。 |
| 01:12 | Yamanaka factor | 以 2006 年 Shinya Yamanaka 發現的四個轉錄因子為例,說明如何把老化皮膚細胞重編程回胚胎幹細胞狀態,這項發現後來拿下諾貝爾獎。 |
| 02:09 | 重編程的應用 | 部分重編程只改變細胞年齡、不改變細胞類型,目標是恢復老化過程中流失的年輕特徵,未來可能發展成對抗老化疾病的藥物。 |
| 03:08 | 為何研究單細胞 | 研究單細胞是為了由下而上建立細胞、組織、器官乃至整個人體的模型,目前已有計畫在繪製人體內每一顆細胞,最終目標是走向 virtual cell、virtual tissue 這類數位分身。 |
| 04:14 | 藥物開發的效率困境 | 運算力持續成長,但每年上市的新藥數量卻在下滑,一款藥從研發到上市可能耗時 10 年、花費數十億美元,AI 的目標是縮短整條研發管線。 |
| 05:56 | 量測單細胞的四種模態 | 基因體、RNA 序列、蛋白質體、型態學各自量測不同東西,RNA 序列因為技術成熟、成本較低,是目前資料量最大的模態。 |
| 07:42 | RNA-seq 資料規模 | RNA-seq 因為量測容易、能靠相關技術規模化,資料集規模從數千萬顆細胞到 5 億顆都有,甚至有計畫要蒐集 10 億顆細胞的資料。 |
| 08:20 | 資料異質性的問題 | 即使量測兩顆一樣的細胞,讀數也不會相同,原因包括細胞變化本身是跳躍式的快照、而非連續紀錄,加上不同實驗室與機台造成的技術性差異。 |
| 10:30 | transformer 類基礎模型 | 把細胞當句子、基因當 token,用類似 BERT 的方式遮蔽部分基因、預測基因表現量,訓練出來的模型可以用在擾動反應預測等下游任務。 |
| 12:16 | 壓縮帶來的資訊流失 | 這類模型把資料壓縮成潛在向量再解碼,卻因此流失大量資訊,去年兩篇 NeurIPS 論文的完整評測也發現,這些模型訓練成本很高,表現仍不如語言與影像領域的同類模型。 |
| 13:31 | 流動匹配模型較佳 | 從高斯雜訊出發、直接比對資料分布的流動匹配模型,在評測上比壓縮再解碼的 transformer 類模型表現更好。 |
| 15:06 | 總結三個重點 | 單細胞研究很重要,量測方式有多種模態可選,目前看來流動匹配模型表現較佳,但仍需要更大規模、品質更好的資料才能類推到沒看過的樣本。 |
值得記的話
名詞與人物
| Altos Labs | 講者任職的生技新創公司,目標是透過細胞回春技術逆轉老化相關疾病與失能。 |
|---|---|
| Yamanaka factor | Shinya Yamanaka 於 2006 年發現的四個轉錄因子,能把成熟細胞重編程回類似胚胎幹細胞的狀態。 |
| RNA-seq | 量測單一細胞裡各基因表現量的技術,資料量最大、最常被用來訓練單細胞基礎模型。 |
| Geneformer | 講者提到的一款把細胞當句子、基因當 token 的 transformer 基礎模型,用於單細胞資料的預訓練。 |
| BERT 式的單細胞基礎模型 | 講者拿來對照的另一條路線,用遮蔽訓練的方式學細胞表現,他沒有點出是哪一款 |
| flow matching | 一類從隨機雜訊出發、直接比對資料分布的生成模型,講者提到這類模型目前在單細胞資料上表現較佳。 |
延伸
- 講者提到 2026 年出現第一款細胞重編程藥物,他說應該是 OSK,語氣上自己也不太確定,沒有再展開。
- 蛋白質體被認為最貼近細胞功能,講者提到已有量測方法,但沒有說明實際技術與限制。
- 講者提到去年在 NeurIPS 發表兩篇針對這類模型的完整評測論文,並在簡報結尾附上連結,但這場沒有展開論文內容。