← 回到天際線 思考機器第 41 層 / 102

EP 1532021-01-112:12:37 ROUND 2

蛋白質折疊與病毒演化的邊界

Dmitry Korkin

生物資訊學者 Dmitry Korkin 談蛋白質與病毒的結構、AlphaFold 解開了什麼與還沒解開的部分,以及這一年病毒演化研究的進展。

Dmitry Korkin: Evolution of Proteins, Viruses, Life, and AI | Lex Fridman Podcast #153在 YouTube 看 ↗

重點6 條

  1. 蛋白質不是簡單的球體,而是模組化的積木:Korkin 說蛋白質其實是由一段段「結構域」(protein domain)串成,像一串珠子;過去因為技術只能解析小蛋白質,才誤以為蛋白質整體都是球形,這個模組化的層次也解釋了選擇性剪接(一個基因剪出多種蛋白質)這類複雜現象。
  2. SARS-CoV-2 有四種結構蛋白,各自扮演不同角色:棘蛋白(spike)是三聚體、負責附著細胞;封套蛋白(envelope)數量最少;膜蛋白(M protein)數量最多、組成外殼的晶格,而且演化上比棘蛋白穩定,他認為是值得研究的藥物攻擊目標。
  3. AlphaFold「解開蛋白質折疊」要看範圍:CASP 競賽過去主要驗證的是結構相對緊湊、單一或兩個結構域的蛋白質;神經系統裡常見的多結構域蛋白質離被完全理解還很遠,折疊本身怎麼發生也仍是謎。
  4. Joshua Lederberg 與 1960 年代的 DENDRAL:Korkin 分享自己讀博士班時,在一個化學論壇貼文求助,隔天意外發現 1958 年諾貝爾獎得主 Joshua Lederberg 本人在底下回了他;他認為 Lederberg 當年設計的專家系統 DENDRAL,就是現代生物資訊學與化學資訊學的起點。
  5. 用機器學習判斷病毒致病性,也帶出雙重用途的疑慮:他實驗室的計畫是想從序列判斷一株冠狀病毒是不是致病株;Lex 問同一套系統理論上是不是也能反過來用,Korkin 說長期而言,他仍然更擔心天然疫情。
  6. 這一年最讓他驚訝的是科學社群的效率:對比二十年前 SARS 花了好幾年才做出的結構解析,這次只花了幾個月,靠的是前所未有的病毒定序數量;尾聲聊了幾本對他影響深的書,也用一首與他同名的詩人寫的俄語詩作結。

時間軸30 段

01 01:50
蛋白質是積木嗎

Lex 問蛋白質是不是生命的基本建構單元,Korkin 說是也不是:蛋白質本身還能拆成「結構域」,像一串珠子串起來,每個結構域各自負責一部分功能,也是演化上被打包移動的單位。

02 06:23
SARS-CoV-2 棘蛋白的結構

以第一個被解出實驗結構的 SARS-CoV-2 蛋白——棘蛋白(spike protein)為例:它是三聚體,冷凍電顯能重建約三分之二,剩下約三分之一嵌在病毒膜裡難以解析;最近一項突變讓更多受體結合域同時打開,可能改變它與人類受體結合的動力學。

03 15:39
病毒的四種結構蛋白

除了棘蛋白,病毒外殼還有封套蛋白(envelope,E,要五個拷貝才作用,每顆病毒大約兩三個)與數量最多、組成晶格外殼的膜蛋白(membrane,M,約一千個二聚體);M 蛋白演化上比棘蛋白穩定,Korkin 認為攻擊外殼是有潛力的藥物方向。

04 20:37
變異株新聞與病毒突變

聊到英國、南非變異株的新聞,Korkin 解釋突變是病毒演化與跨物種傳播的方式,每次跨物種都可能帶來新突變;他不太擔心疫苗會很快逼出逃脫突變,但強調理解病毒演化機制有助於預測未來走向。

05 27:20
拉遠鏡頭看蛋白質演化

Lex 提議拉回蛋白質演化史,Korkin 說如果要選一個關鍵字,會是「模組化」:結構域不只是功能單元,也是演化單元,很少在演化中被拆散;結構域之間完全柔性的「連接段」(linker),反而是蛋白質互動的重要介面。

06 32:43
一個基因不只一個蛋白質

透過選擇性剪接(alternative splicing),同一個基因可以剪出多種不同的蛋白質產物;這個過程不是隨機的,常對應疾病或細胞發育階段,外顯子(exon)邊界也經常跟結構域邊界重疊。

07 37:09
程式能不能像細胞一樣演化

Lex 說他印象中是 Douglas Hofstadter 取了「quine」(自我複製程式)這個名字,問程式能不能像細胞一樣演化、互相配對;Korkin 說寫出會自我複製的程式當年是資訊奧林匹亞的關卡之一,接著就比誰寫得最短。他再從演化演算法回應:重組會讓搜尋軌跡出現全域變化,突變是較細緻的搜尋步驟,也提到他印象中最早由日本團隊提出的「黏菌演算法」,認為自然界還有很多東西沒被借用過來。

08 44:32
德雷克方程式與生命起源

Lex 提到自己做過探討「德雷克方程式」的影片,問生命在一個適居行星上出現的機率;Korkin 提到 2018 年一篇論文在一顆彗星(他自己也不確定俄文唸法)的塵埃裡發現最簡單的胺基酸之一甘胺酸。Lex 自己給的機率是 1%,Korkin 說憑直覺他會給得更低。Lex 接著介紹跟德雷克方程式相對的「地球稀有假說」,Korkin 認為現實通常不落在極端,地球或許不是獨一無二,但也不會是隨處可見;若真有地外生命,他猜多半仍是碳基,即使只找到單一細胞也會是科學的一個轉捩點。

09 54:04
Joshua Lederberg 的故事

Lex 說明 Lederberg 33 歲就以「細菌可以交配交換基因」拿下 1958 年諾貝爾生理醫學獎,也協助 NASA 找火星生命、開發化學專家系統 DENDRAL;Korkin 接著分享親身故事:他 2000 年在加拿大念博士,研究符號式機器學習在藥物設計上的應用,在一個計算化學論壇貼文求助,隔天指導教授告訴他「你猜誰回你了」——回信的正是 Lederberg 本人,說兩人在 DENDRAL 專案裡想法相近;後來他到洛克斐勒大學做博士後,一部分原因就是希望能當面見到 Lederberg,也真的見過一面、簡短聊過。

10 1:00:24
DENDRAL 的構想

Lederberg 想做一個系統,協助從質譜分析資料反推地外分子的化學結構:輸入質譜數據與可能分子的資料庫,輸出候選清單再交給化學家判斷。Korkin 認為這是現代生物資訊學的起點,而且早在 1960 年代就做出來了;他也談到專家系統為何式微:歷史上有兩種說法,一是它不如預期而被取代,二是正好相反,它太成功、成了通用的東西而被轉化;他說兩種說法的結果一樣,都是演化成別的形式——包括 AlphaFold 這類把領域知識內建進系統的作法。

11 1:05:18
CASP 競賽是怎麼運作的

話題轉到 AlphaFold2 被宣布「解開蛋白質折疊」;Korkin 說社群把各種蛋白質預測競賽稱為「生物資訊奧運」,最早也最出名的一項是 CASP:實驗學家先解出結構但先不公開,只釋出序列,讓社群預測 3D 結構後再跟真正解出的結構比對評分。

12 1:07:54
折疊機制本身仍是謎

Korkin 說折疊怎麼發生在機制上還沒被完全理解:有假說認為結構域各自獨立折疊,但連結構域內的次結構何時成形都還不清楚;他說折疊極有效率又穩定,Lex 補說它幾乎每次都折成同樣的形狀,Korkin 同意;而且蛋白質還沒完全轉譯完成、還在核糖體上時就已經開始折疊。

13 1:11:15
從同源建模到 AlphaFold 的突破

歷屆 CASP 表現最好的團隊,用的不是機器學習,而是進階生物物理學結合生物資訊學與資料探勘。有親緣相近、已知結構的蛋白質時可以做「同源建模」;真正困難的是完全沒有結構親戚可以參考的「從頭預測」,而傳統方法在這一塊一向表現很好,直到 2018 年第一代 AlphaFold 一舉超越所有人,靠的是預測蛋白質不同部位之間的「接觸圖」。

14 1:14:13
AlphaFold2 再進一步

AlphaFold2 又一次超越所有人,進一步運用演化上的相似性:蛋白質結構比序列更保守,即使沒有結構資料,只要有大量不同物種的同源序列排列比對,也能推知哪些位置保守、哪些多樣。訪談當時 AlphaFold2 的論文還沒發表,Lex 說外界看到的只是 DeepMind 行銷團隊寫的部落格文章;Korkin 說那大概只和真正用的方法有些相似。

15 1:18:11
「解決了」是指哪個範圍

Korkin 提醒要回到一開始的討論:一般蛋白質不是單一結構域,CASP 過去主要聚焦在單一或兩個結構域、相對緊湊的蛋白質;但神經系統裡常見的蛋白質大多是多結構域,其中有些有五、六、七個甚至更多,那個層次的折疊還遠遠沒有被理解,「解決了」指的是前一種範圍。

16 1:20:22
跟 AlphaZero 不一樣的資料限制

不像 AlphaZero、MuZero 靠自我對弈就能生出無限訓練資料,已解出的蛋白質 3D 結構數量還是很有限;Korkin 認為可以借助根據演化資訊推得的高品質同源模型來擴充訓練資料,他對這個方向樂觀,認為這是機器學習系統真正超越傳統生物物理方法的一次轉折。

17 1:22:11
AI 史上最大突破排第幾

Lex 列出候選名單:AlphaGo 擊敗圍棋世界冠軍、Deep Blue 擊敗 Kasparov、AlexNet 帶動電腦視覺、GPT-3 與 transformer、波士頓動力的機器人工程、Waymo 與 Tesla 的自駕車,問 AlphaFold 該排第幾;Korkin 說自己未必是回答這題的最佳人選,但就對科學與社會的影響而言,AlphaFold 該排進前三名,也回憶 1997 年 Deep Blue 擊敗西洋棋王 Kasparov 帶給他的震撼;Lex 說那大概是機器第一次在這種層級上贏過人類,Korkin 同意。兩人接著聊到搜尋在智慧裡可能被低估的地位,提到訓練 AI 模仿林布蘭風格、印出一幅從未存在過的肖像的計畫,以及音樂與電影領域至今還沒出現一部真正賣座的 AI 創作。

18 1:30:48
自己 AI 課上的俳句與音樂實驗

Korkin 提到自己開的 AI 課,最喜歡學期末的專案發表:前一年有組學生做出訓練在英文俳句上、能生成日式俳句的 AI,讀起來頗有味道;也有組別教 AI 彈古典樂、搖滾樂、流行樂,他觀察到古典樂是最難的幾種之一:像巴哈那種數學結構很強的風格,他覺得至少某些部分學得起來,但換到其他類型的古典作曲家,不用看資料、聽一下就知道「還不到」。

19 1:33:59
多蛋白質複合體與他最愛的蛋白質

話題轉到多結構域蛋白質怎麼形成複合體,同時牽涉折疊與蛋白質-蛋白質交互作用;Korkin 舉自己讀博士後時研究的 PSD-95(突觸後緻密區關鍵蛋白,約六百多個胺基酸、五個結構域)為例,說明它靠柔性結構當「鷹架」,把其他蛋白質串在一起協同運作。

20 1:36:39
CAPRI 競賽與他自己的評分函數

蛋白質-蛋白質交互作用有自己的競賽 CAPRI;Korkin 的實驗室平常不太參加競賽(太耗時),但大約十年前參加過幾年,設計了 CAPRI 裡最早的幾個機器學習評分函數之一,用來判斷一組預測出來的交互作用結構像不像真正實驗解出的結果。

21 1:38:12
諾貝爾獎會不會給 AlphaFold

Lex 問 AlphaFold2 會不會帶來一座甚至多座諾貝爾獎;Korkin 說諾貝爾獎注定會跟著科學本身演變,現在的重大進展都是跨領域的,計算方法遲早會被承認,而且早有前例——當年研究蛋白質折疊原理獲獎的三個人,他記得都是計算生物物理學家。

22 1:40:42
用機器學習設計蛋白質

Lex 問能不能用機器學習設計蛋白質——Korkin 說這已是成熟領域,點名先驅 David Baker 與他的 Rosetta 演算法,可以做全新蛋白質的「從頭設計」;他說自己實驗室的計畫是想從序列判斷一株冠狀病毒或流感病毒是不是致病株,目前還在進行、可用的資料不多。他提到 Eugene Koonin 團隊在 bioRxiv 上有一篇相關研究,用的是標準的監督式學習,接下來的問題是能不能換更進階的方法(例如遷移學習)往前推。

23 1:45:30
雙重用途的疑慮

Lex 問,同一套能預測病原性的系統,理論上是不是也能反過來用來設計更危險的病毒;Korkin 認為就算設計出序列,實際做出可行的病毒仍是完全不同層次的實驗難題,而且一旦科學社群意識到這不再只是機器學習的好玩題目,可能會出現管制——他提到約 2015 年流感增益功能研究曾有過半年左右的暫停,直到學界審查認定安全才恢復。

24 1:48:52
天然疫情還是人造病毒更該擔心

Lex 問往後五十年、一百年看,該擔心的是天然疫情還是人為製造的疫情;Korkin 說他仍然更擔心天然疫情,因為大自然本身就很擅長製造疫情。Lex 接著說拿病毒當武器的動機很奇怪,因為病毒沒有飛彈那種明確的起點和終點,真要說目標,那個目標會是整個人類物種。

25 1:51:15
這一年學到了什麼

兩人上次對談是三月或四月,Lex 問這幾個月他的理解有什麼變化;Korkin 說最讓他驚訝的是科學社群的效率——對比約二十年前 SARS 花了好幾年才完成的結構解析,這次只花了幾個月,靠的是前所未有的病毒定序數量,能精確追蹤病毒與特定地區、人群之間的協同演化。

26 1:54:26
還想要更多資料

Korkin 提到他的團隊最近參加了 XPRIZE 的疫情預測競賽(預測不同地區的感染人數);Lex 說資料雖然比以前豐富,還是不夠豐厚,並轉述他訪問過的哈佛學者 Michael Mina 想做一張像天氣圖一樣即時、高解析度的「病毒地圖」,追蹤各種病毒在人與人之間的傳播,有助於理解病毒逐日的演化與應對未來的疫情。

27 1:55:46
書單:兩本俄語經典

Lex 問影響他最深的書,Korkin 先給了兩本俄語作品:布爾加科夫的《大師與瑪格麗特》,他說書的結尾至今讀了還會起雞皮疙瘩,喜歡它把跨越幾世紀的平行故事交織在一起,用魔法包裹的愛情與蘇聯時代的黑色幽默;以及索忍尼辛的《癌症病房》,取材自索忍尼辛自己年輕時罹癌又完全康復的經歷,寫一位被判終身監禁、關在勞改營的人被送進癌症病房後的遭遇,他讀過有醫生評價這本書寫病人的心理準確到值得每個醫生一讀。他說這本書有好幾層意涵,癌症在書裡也對應著蘇聯體制;索忍尼辛自己說過,是把身在體制內、被送進古拉格、以及罹癌這三段經驗放在一起想,而這本書與《古拉格群島》正是讓他拿到諾貝爾獎的作品。

28 2:01:44
第三本書:馮紐曼寫在臨終前的書

第三本換成一本英文著作:John von Neumann 的《The Computer and the Brain》,Korkin 說它嚴格講不算書、是一篇長文,很薄卻極度濃縮,寫於他確診癌症、明知自己將不久於人世之時,1957 年他過世後才在 1958 年出版;Korkin 說裡面每一段都密密麻麻塞滿想法,嘗試在大腦運算能力和當年的電腦之間找平行;Lex 也提到 Ed Witten 是另一位常被形容成「見過的人都說他是智力巨獸」的人物。他也額外推薦了一本有聲書:地球化學家 Hope Jahren 親自朗讀自己寫的《Lab Girl》,某些段落甚至聽得出作者哽咽。

29 2:05:43
新年展望:暑期學校與陪家人

被問到 2021 年的期待,Korkin 說最想念的是每年夏天去歐洲參加的分子與理論生物學國際暑期學校(給資優青少年辦的營隊,由他的好友們籌辦),2020 年沒能親自到場、只能遠距辦;居家工作這段期間也讓他意識到自己過去太容易被學術生活占滿時間、忽略了陪家人,新年新希望是即使世界恢復正常,也要繼續把時間留給家人。

30 2:08:04
朗讀一首俄語詩作結

Lex 請 Korkin 朗讀一首俄語詩;Korkin 讀的是一位跟他同名(Dmitry)的詩人寫的近作,題目大致是「女巫」之意,是他少數能背出來的詩之一,也讓他聯想到《大師與瑪格麗特》的女主角瑪格麗特。讀完後兩人聊詩裡那種「遠在天邊卻近在眼前」的感覺,也聊到俄語詩特有的、翻譯不出來的味道。