← 回到天際線 思考機器第 19 層 / 102

EP 932020-05-051:12:03

Koller 談機器學習加速藥物發現

Daphne Koller

Daphne Koller 談創辦 Insitro、用培養皿疾病模型找藥,也聊 MOOC 心得與 AGI 還有多遠。

Daphne Koller: Biomedicine and Machine Learning | Lex Fridman Podcast #93在 YouTube 看 ↗

重點6 條

  1. Insitro 反過來設計資料:過去機器學習對疾病研究貢獻有限,因為現成資料集規模與品質都不夠;Koller 創辦的 Insitro 反過來,先用生物工程方法設計出能餵給機器學習的資料,而不是拿別人做實驗剩下的資料做分析。
  2. 培養皿裡的疾病取代動物模型:小鼠不會自然得阿茲海默症、糖尿病或自閉症,在動物身上「治好」的病常常無法轉譯到人類;她的做法是把人的皮膚細胞逆轉成誘導多能幹細胞(iPS),分化出帶有本人基因的神經元或心肌細胞,直接觀察生病的細胞長什麼樣。
  3. 規模仍是限制:她印象中全球 iPS 細胞株約五千到一萬條,不足以為每位病人單獨建模,但可以用 CRISPR 在健康細胞植入已知致病突變,做健康對照與患病細胞的一對一比較。
  4. MOOC 該短、該有即時回饋:她從 Coursera 的經驗歸納出線上課程要拆成 5 到 7 分鐘的短單元、搭配自動評分的小測驗;但學習仍然是社交經驗,她不認為線上課程會取代面對面教學。
  5. 模型的自信程度常常校準得很差:離訓練資料分佈越遠,模型往往錯得更離譜,卻也更有自信,她認為這在醫療診斷、自動駕駛這類場景可能致命,呼籲讓模型校準自己的不確定性,碰到沒見過的資料時能說不知道。
  6. AGI 還很遠,但笨系統已經會出包:她認為現有系統仍是特定領域的模式辨識高手,換個問題版本就可能失靈,離人類幼兒的泛化能力還差得遠;比起擔心超級智慧接管世界,現在系統的複雜度已經帶來難以預期的連鎖效應。

時間軸25 段

01 02:07
開場的哲學提問

Lex 問她是否有一天能治癒所有主要疾病、甚至延長壽命到接近永生;Koller 說「有一天」時間太長,她不喜歡斷言做不到什麼,但也指出目前真正稱得上「治癒」的疾病其實很少。

02 04:11
主要疾病的理解程度

依疾病而異:她認為阿茲海默症、思覺失調症的理解程度接近 0,第二型糖尿病介於兩者之間:胰島素阻抗等機制已經驗證,但還有很多沒弄懂;這些病幾乎可以確定不是單一疾病,而是臨床表現相似、細胞機制卻各異的一群病,就像乳癌一樣。

03 06:39
老化與健康壽命

老化與疾病的機制有重疊(DNA 損傷累積、蛋白質錯誤折疊),但不完全等同;她認為值得追求的目標是延長「健康壽命」,活到 120 歲仍保持高品質生活,而不是單純追求永生。

04 10:14
資料與機器學習的角色

過去機器學習對疾病研究貢獻有限,因為缺乏足夠規模與品質的資料集;Insitro 把順序反過來,先用生物工程與細胞生物學的方法設計出機器學習可用的資料,而不是拿現成資料做分析。

05 13:14
投入健康領域的契機

她提到早年在機器學習圈用的是 20 newsgroups 這類不太有趣的資料集,轉向生物資料是因為覺得更有意義;也提到父親約 12 年前過世,生前有侵犯肺部的自體免疫疾病,醫師說只能用 prednisone,現在同類疾病已經有更多選擇。

06 16:24
培養皿裡的疾病模型

對比傳統動物模型的問題:小鼠不會自然得阿茲海默症、糖尿病、動脈硬化、自閉症或思覺失調症,在動物身上「治好」的病常常無法轉譯到人類。

07 18:19
iPS 細胞逆轉技術

可以把皮膚細胞逆轉成多能幹細胞,再分化成帶有本人基因的神經元或心肌細胞等,用來觀察「生病的細胞長什麼樣」;這一步現在幾乎工業化,有委託研究機構(CRO)代做,但細胞可能還保留一點過去的「記憶」。

08 21:46
規模限制與 CRISPR

全球現有的 iPS 細胞株她估計約五千到一萬條,規模還不到能為每位病人單獨建模;可以用 CRISPR 在健康細胞裡植入已知致病的突變,做「健康對照 vs 患病」的一對一比較。

09 23:53
基因差異與疾病風險

不同人的幹細胞差異主要來自基因型不同;她用多基因風險分數(polygenic risk score)解釋:把個人基因組裡所有跟某疾病相關的變異加總,某些疾病上,風險最高與最低的十分位族群之間有時差到 10 或 12 倍。

10 26:53
把細胞轉成數位資料

微陣列(測量整個基因體的表現量)、單細胞 RNA 定序、超解析顯微鏡等技術,讓原本「濕答答」的細胞可以被量化成資料。

11 30:02
從資料到藥物發現

用機器學習找出臨床表現相似、但分子層次不同的疾病亞型,再測試哪些介入(藥物或 CRISPR)能讓患病細胞的樣態回復成接近健康細胞。

12 33:28
哪些疾病適合這套方法

她不想先開支票,只說遺傳基礎強、細胞模型可重現、侷限在少數細胞類型的疾病較適合;她也提到類器官(organoid),三到五年後,有些現在做不出模型的疾病就做得出來。

13 36:35
轉場:MOOC 的起源

話題轉向 Coursera:她與 Andrew Ng 在史丹佛內部各自嘗試線上教學,2011 年秋天課程上線後迅速吸引大量學生,兩人因此決定創辦 Coursera。

14 40:19
渴望學習的世界

她認為推動線上學習熱潮的核心是「對學習的渴望」,因為現在許多工作所需的技能,在人們念大學時根本還不存在。

15 41:42
線上教學學到的事

課程要短(早期 MIT OpenCourseWare 錄整堂課效果不好,Coursera 的短影片後來也從 15 分鐘再縮到 5 到 7 分鐘)、要有即時回饋(如自動評分的小測驗);也做過讓女性擔任教師角色的 A/B 測試,觀察對理工課程性別比例的影響。

16 47:29
MOOC 不會取代面授

她不認為線上課程會取代面對面教學,因為學習很多時候是社交經驗,學員自組讀書會的學習效果更好;但持續進修這塊會越來越倚賴線上內容。

17 49:08
學習機器學習的建議

建議先打好數學、統計與程式基礎,不要跳過就直接學機器學習,否則容易只會套用現成模型、也看不出結果哪裡不對;接著找人一起動手解決實際問題或參加競賽。

18 51:15
最有意思的兩個概念

被問到最美或最有意思的概念,她舉了兩個:端到端訓練(直接從原始資料訓練到最終目標),以及可以遷移到其他任務的表徵學習(transfer learning)。

19 52:50
高維空間的意外表徵

讓她意外的是:資料量夠大時,居然能在極高維的空間裡找到有意義的表徵;早年她認為需要更多先驗知識才能學到東西,現在不同任務的架構仍然各自帶著不同的結構假設。

20 55:13
模型的不確定性危險

許多機器學習模型給出答案時,對自己的信心程度往往校準得很差;離訓練資料分佈越遠,模型往往錯得更離譜,卻也更有自信,在醫療診斷、自動駕駛這類場景可能致命;Bayesian deep learning、Gaussian processes、用不同資料子集訓練的網路組合都是給出不確定性的方法,但她說這仍是開放的研究。

21 58:58
AGI 還有多遠

她認為 AGI 仍是長期以來的夢想,但離實現還很遠:現有機器學習演算法是特定領域裡的模式辨識高手,換一個版本的同個問題就可能完全失靈,離人類幼兒的泛化能力還差得遠。

22 1:01:58
笨系統已經會出包

她不擔心機器接管世界,認為現在就設計防範人類等級智慧的措施還太早;比起這個,更笨的系統已經因為複雜度太高、難以預期的連鎖效應而出過問題:電網、金融市場的軟體都非常複雜,回饋迴路沒料到就引發過金融崩盤;她呼籲加強可解釋性與跨情境的泛化測試。

23 1:04:49
技術被濫用的風險

她認為任何強大的技術都可能被濫用,CRISPR 基因編輯若被拿來做壞事(例如製造病毒),危險程度不亞於機器學習。

24 1:06:47
對人性整體樂觀

她說自己整體樂觀,認為大多數人本意是好的,但不代表大多數人都是利他的好人;但她也提醒,社會需要維持「做好事」與「被同儕肯定」正相關的規範,否則社會容易走向反面。

25 1:08:58
人生的意義

被問到人生意義,她提到 Coursera 創辦時正好是 Steve Jobs 過世,當時流傳的一句話「在宇宙留下一點痕跡」讓她特別有共鳴;也談到自己身為受良好教育、家境穩定的人,覺得有責任用人生讓世界變得更好。