← 回到天際線 思考機器第 1 層 / 102

EP 402019-09-231:17:29

乳癌倖存者的深度學習抗癌路

Regina Barzilay

MIT 教授 Regina Barzilay 罹患乳癌後,把研究重心轉向用深度學習做癌症早期偵測與藥物設計,也談了資料所有權與機器翻譯的極限。

Regina Barzilay: Deep Learning for Cancer Diagnosis and Treatment | Lex Fridman Podcast #40在 YouTube 看 ↗

重點6 條

  1. 罹癌後重新評估研究的意義:她 2014 年確診乳癌,花了兩個半月才確定病情;治療期間看到其他病友的辛苦,讓她開始覺得學術圈追逐的瑣碎進展沒有意義,轉而把心力放在真正能幫上病患的研究。
  2. 短期內看得到的是提早發現,不是治癒:她不敢斷言人類什麼時候能治癒癌症,但認為機器學習比較快能做到的是提早發現;像胰臟癌這種預後極差的癌症,只要能提早發現,就有辦法治療。
  3. 多數人根本不知道自己的風險:現行的乳癌風險評估工具太簡略,八成乳癌患者甚至沒有家族病史;她認為把影像、其他檢查結果,以及將來的液態切片等多種微弱訊號整合起來,機器學習才能做出比現行工具準確的早期預測。
  4. 拿到醫療資料比寫演算法難得多:她花了兩年才拿到資料使用權,美國至今沒有公開的現代乳房攝影資料集,醫院對釋出資料也缺乏誘因;她主張讓病人能像器官捐贈一樣,自己決定要不要把資料捐給研究。
  5. 技術常常早就準備好了,卡住的是採用流程:乳房密度分級源自 1967 年歸納出的影像模式,沿用至今,直到 2019 年才成為聯邦法律;她認為現在的演算法早就比舊方法準,真正的障礙是說服醫院與病人改變既有做法,不是演算法不夠好。
  6. 機器翻譯進步驚人,換個領域就崩:機器翻譯在她剛入行時她覺得像天方夜譚,十年內卻真的做到;但換個生疏一點的領域,翻譯品質照樣會崩壞,她認為這是泛化能力的問題;她也認為圖靈測試量到的其實是人有多想相信,不是技術本身多厲害。

時間軸26 段

01 00:48
書如何形塑世界觀

她提到《The Emperor of All Maladies》讓她看清科學發現過程的不精確,也提到小說 Americanah 精準呼應了自己身為移民的經驗;她說科學發現有時靠的不是想法本身多強,而是推動它的人有多投入。

02 05:03
想法與人

Lex 問她是否認為人比想法重要,她修正說不一定更重要,而是光有想法不夠,短期內是人的投入決定想法能不能被採用;她舉 NLP 的統計方法因為一些人物不相信而晚了很久才成主流為例。

03 07:14
藥物研發的起點

她提到藥物化學是從 19 世紀德國與英國的染料工業發展出來的;也提到當年 Dana-Farber 的 Farber 醫師做的化療實驗有計算錯誤,受試的白血病兒童過世,讓她看見這個過程有多不完美。

04 08:34
電腦科學看生醫

她認為電腦科學能在許多領域成功,某種程度上是因為不執著於「理解」,例如 Amazon 不需要懂你、只要能猜對你想買什麼;相較之下生醫領域傳統上很在意機制性的理解,這種堅持不一定必要。

05 11:56
確診乳癌面對死亡

她 2014 年、43 歲時確診乳癌,第一次真正意識到自己可能會死;診斷後有兩個半月不確定病情,情緒在希望與絕望之間反覆。

06 13:17
重新評估研究的意義

回到 MIT 後,她回頭看自己與同事在做的研究,覺得學術圈在意的許多瑣碎進展(例如把某個指標推進兩三個百分點)相較於她剛經歷的處境顯得毫無意義。

07 15:42
目睹病友的苦難

治療期間她每天都要去醫院,看到很多病友的處境比她更差;有次朋友帶她去買生日禮物,看到一般人輕鬆歡笑的樣子,她才意識到自己已經活在一個完全不同的世界裡。

08 18:01
癌症的規模與治癒

Lex 引了美國每年新增 170 萬例癌症、60 萬人因癌症過世的數字,問人類何時能治癒癌症;她不敢斷言人類何時能治癒癌症,但認為機器學習有機會讓許多癌症提早被發現、更有效運用既有療法。

09 20:09
早期偵測是關鍵

胰臟癌等疾病往往到晚期才被發現,存活率因此極低;她提到有病人是因為食物中毒去做檢查,意外掃描出早期病灶而撿回一命,說明早期偵測本身就能救人。

10 21:52
機器學習如何幫助診斷

多數乳癌患者其實沒有家族病史,現行風險評估工具也給不出有用的答案;她認為機器學習可以整合影像等多種微弱訊號,做出比人眼更準的早期預測。

11 23:41
取得醫療資料的困境

她花了兩年才拿到資料使用權;美國目前沒有任何公開的現代乳房攝影資料集,醫院對釋出資料也缺乏誘因,整個申請流程非常繁瑣;她希望病人能像考駕照時決定要不要捐器官一樣,自己決定要不要把資料捐給研究。

12 27:19
隱私的技術與制度解方

她把解法分成技術與社會兩面;技術上可以靠去識別化、或在編碼過的資料上訓練模型來保護隱私,其中有些方法是她在 MIT 開發的。

13 29:45
每週寄來的乳房攝影

她演講後常收到女性來信請她跑模型,幾乎每週都有乳房攝影送到她 MIT 的辦公室,她會把結果交給對方的醫師;她用這件事說明每個人都可能需要資訊來做攸關性命的決定,而她自己罹病時就曾沒有資訊可以依據。

14 30:53
病人該擁有資料嗎

Lex 提到 Google Health 與微軟的 HealthVault 都曾想讓病人帶著資料走,後來都關了;她認為這是交換資料的正確方向,換新醫院時常拿不到自己的資料,乳房攝影還得燒成 CD 寄送。

15 34:38
乳房密度案例

1967 年放射科醫師 Wolfe 從確診者的影像歸納出乳房密度的模式,後來才定成四個等級沿用至今;40% 到 50% 的女性屬於緻密型,等於一半的人被告知高風險。直到 2019 年、在川普政府任內才正式成為聯邦法律,她認為這說明技術往往早就準備好了,卡住的是漫長的採用流程。

16 39:24
誰來推動醫療 AI

她認為沒有單一的答案,但身為消費者(也就是病人自己)的聲音,可能是最有力推動改變的一股力量。

17 41:15
被忽略的藥物設計

她指出還沒有任何一種藥是靠機器學習模型開發出來的,連在過程中扮演重要角色的都沒有;小分子藥物可以表示成圖(原子是節點),傳統流程靠高通量篩選加上化學家的專業判斷去優化分子。

18 48:32
MIT 團隊的兩個方向

第一個方向是預測分子性質的模型;第二個方向類似機器翻譯,把一個分子「翻譯」成經過改良、更符合需求的版本。

19 50:24
NLP 發展的三十年

她 1997 年入行時,規則式的語言學方法與語料庫統計方法還並存;後來統計方法逐漸主導整個領域,語言學在論文裡的角色也愈來愈淡。

20 53:30
機器翻譯的進展與脆弱

她形容當年覺得做出真正的機器翻譯像天方夜譚,沒想到十年內就真的實現、成為日常工具;但換到生疏一點的領域,翻譯品質照樣會崩壞,她每年上課都用一份翻得慘不忍睹的芬蘭語食譜當例子。

21 58:56
圖靈測試與願意相信

她提到在中國參訪騰訊時看到一款聊天機器人,據說當地有大量使用者會跟它聊上好幾個小時;也提到 MIT 教授 Weizenbaum 開發的 ELIZA,發現人們太容易相信機器懂自己。她認為真正的重點不是技術有多厲害,而是人有多願意相信。

22 1:01:54
少樣本學習

被問到下一個 NLP 的基準,她認為是真正做到從少數例子學習;現在論文裡從 55 分提到 65 分的那種進步,實際上都派不上用場。

23 1:02:41
衡量類人智能

她認為衡量智能的方式,應該看一個系統能不能在很多不同領域都做到人類能做到的事,而不是它是不是用跟人類一樣的方式運作。

24 1:04:51
認知增強的想像

她提到小說 Flowers for Algernon 裡讓病患智力大幅提升卻也帶來代價的療法;Lex 提到前一天 Neuralink 的腦機介面示範,她說直接連結大腦只是其中一條路;她也提到用 MIT 健身房的計分 app 後,發現自己會為了不想掉等級而在傷後硬跑。

25 1:09:05
教學觀察與建議

為了讓非本科生也跟得上,她新開了一門偏建模、本科與非本科都收的機器學習小班課,發現學生真正卡關的是數學基礎(線性代數、機率、Big O 符號),不是寫程式;給有志投入這個領域的人,她建議先找到一個自己真心在乎的問題,用它帶動學習。

26 1:14:10
人生意義的大哉問

被問到人生與研究的意義,她說沒有一個放諸四海皆準的答案;重點是花時間找到自己真正在乎的使命,不要被外界的期待與虛榮心牽著走。