AI 看病可以,責任誰扛
從專家系統到 ChatGPT,李友專拆解醫生診斷一致率、AI 準確率與簽章責任的落差,探討 AI 距離真正取代醫生還有多遠。
重點摘要
診斷本身就沒有標準答案:醫學上「症狀」跟「診斷」常被混用,連頂尖醫師之間的診斷一致率也普遍低於七成,用這個基準來看,AI 診斷率贏過醫生的說法其實還有很多需要拆解的地方。
從專家系統到泛用 AI:李友專回顧自己念醫學資訊的起點,是只能診斷腦膜炎的專家系統 Mycin;相較之下,ChatGPT 能跨領域作答,已經很接近通用人工智慧。
理解比記憶更值錢:人腦的記憶跟理解本來就混在一起,運作方式跟電腦分區儲存不一樣,重點不是背了多少,而是理解之後能不能組合出新東西。
卡關的是責任不是能力:問診跟觸診還是需要人力輸入資訊,但真正卡住 AI 全面取代醫生的,是簽章開藥背後要有人扛責任,這點可以用自駕車 Level 5 的責任歸屬邏輯來類比。
導入決策卡在院長手上:醫院要不要用 AI 看診,決定權通常握在自己也是醫生的院長手上;值班與偏遠地區出診反而可能是 AI 比較快派上用場的場景。
時間軸
00:00
開場Dr. Harvey 介紹博班恩師李友專,帶出「AI 是否會取代醫生」這個老問題為何又被搬上檯面。
01:13
話題再起ChatGPT 展現的能力,加上有研究稱 AI 某些疾病診斷率超越醫生,讓還在念書的醫學生開始焦慮未來。
02:01
從醫學系到醫學資訊李友專自述畢業後沒有直接當住院醫師,而是去念醫學資訊,啟發者是能診斷腦膜炎的 AI 系統 Mycin。
03:33
專家系統 vs 泛用 AI說明 Mycin 這類專家系統只能處理單一任務,屬於狹義 AI;ChatGPT 能跨領域作答,已經很接近通用人工智慧。
05:08
比想像中快很多回顧 ChatGPT 自 2022 年 11 月上市以來,短短兩年就顛覆了原本「至少還要十年」的預期。
06:40
奇異點的討論引述業界說法,一旦 AI 能修改自己的程式碼,進步速度會失控式加快,逼近所謂的奇異點。
08:55
學生的記憶焦慮學生發現拚記憶力已經贏不了 AI,讓依賴背誦拿高分的考試邏輯開始站不住腳。
09:55
理解比記憶重要人腦記憶跟理解本來就混在一起,運作方式跟電腦分區儲存不同,重點是為理解而記,而不是為考試而背。
12:02
AI 也能想點子材料科學研究讓 ChatGPT 生成大量構想,其中約半數被判定為新且可行,但仍需要人類把關。
13:34
那篇論文的問題指出被熱議的那篇論文其實沒有經過同儕審查,醫學診斷本身的定義也很模糊,症狀跟診斷常被混為一談。
15:38
醫生自己都對不齊頂尖醫師之間的診斷一致率通常低於七成,AI 雖能到九成,但大型語言模型本身也有一成左右的答案變異。
18:13
誰來輸入資訊指出 AI 要看診還是需要有人問診觸診、輸入症狀,這一步目前還是少不了醫生。
19:33
責任決定一切比照自駕車 Level 5 的責任歸屬,只要有人願意扛 AI 診斷錯誤的責任,理論上就能取代部分醫師工作,ChatGPT 甚至已經通過美國醫師國考。
20:20
誰來拍板導入醫院要不要導入 AI 看診,決定權通常握在自己也是醫生的院長手上,形成一種角色上的矛盾。
20:51
值班與偏遠地區從值班工時吃緊到離島出診的高昂時間成本,兩人談 AI 值班、AI 駐診可能會是最快被接受的場景。
值得記的話
「那個答案讓你覺得他根本理解你在講什麼」
05:24
「我們現在覺得兩年已經進步很多了對不對以後的兩年可能是 200 年的進步」
08:25
「他們之間的一致性都不會大於 70%」
15:38
「那同樣的道理如果有人出了一個 AI 說診斷錯誤我負責」
19:33
「其實醫生最大的 power 就是他可以去簽章開藥這樣」
18:29
名詞與人物
- Mycin
- 世界上第一個能用人工智慧診斷腦膜炎的系統,是李友專投入醫學資訊領域的啟發者。
- ANI(狹義人工智慧)
- 只能處理特定任務的人工智慧,這集用來形容 Mycin 這類專家系統。
- AGI(通用人工智慧)
- 能跨領域回答各種問題的人工智慧,這集認為 ChatGPT 已經很接近這個層次。
- 奇異點
- 科技進步快到讓人無法預測後續發展的臨界點,這集認為已經很接近。
- Eric Schmidt
- 曾任 Google 執行長,現在多做創投,這集引用他預測 AI 在兩到五年內會開始修改自己的程式。
- AlphaGo Zero
- 不需要人類棋譜、完全靠自我對弈進步的圍棋 AI,這集用來比喻 AI 自我優化後進步無限快的情境。
- 自駕車 Level 5
- 完全不需要人類介入的自駕等級,這集用來類比 AI 若承擔全部責任,理論上也能取代部分醫師工作。
- USMLE(美國醫師國考)
- 美國的醫師執照考試,這集提到 ChatGPT 已經能通過這項考試。
- ICD(國際疾病分類系統)
- 用來替疾病編號分類的系統,這集指出它裡面其實混雜了不少單純的症狀,而非嚴謹的診斷。
延伸
- 兩人在結尾提到之後可能會再開一集,回答觀眾對醫療 AI 提出的其他問題。
- 提到材料科學領域已有研究讓 ChatGPT 產生新想法,其中約半數被判定可行,這部分的評估方法沒有進一步展開。
- 提到到望安、將軍等離島出診的經驗,說明偏遠地區醫療的時間成本,但沒有深入談實際導入 AI 遠距看診的具體做法。