010 · Dora 上線前的安全證據
打電話問診的臨床 AI Dora,不能拿病人做 A/B test,只能靠模擬與自動判官一步步換來上線的證據。
原標題:Shipping AI to a Million Patients Without an A/B Test — Jared Joselowitz, Ufonia
重點摘要
- Dora 是什麼、規模多大Ufonia 的 Dora 是打電話給病人做術後追蹤、術前確認的語音 agent,在英國 20 家醫院做過約 20 萬通真實臨床電話,合約要在兩年內擴大到百萬病人;美國也已在兩家診所上線,另簽了六家。
- 病人身上沒辦法 A/B test把病人分到較差版本不合倫理也可能違法,電話一旦說出口就收不回,模型在某個 benchmark 拿到的分數在事後審查時也不算數,這三個限制讓一般軟體的上線做法失靈。
- 借鏡自駕車,建了 Matrix 模擬框架比照自駕車先跑幾百萬英里模擬才真的載人,Ufonia 用 LLM 扮演病人(Patbot),在特定臨床情境下跟 Dora 對話產生模擬對話,取代找真人演員做測試。
- 找真病人驗證模擬夠不夠真把「真人醫病對話」跟「Dora 對 Patbot」的對話放在一起給病人比較,四組裡有三組多數人反而覺得模擬對話比較真實,但也發現沒有唯一標準的「真實病人」,得模擬各種不同人格。
- 自動判官取代人工看對話模擬對話量太大,人工看不完也不是臨床專業,於是另訓練一個模型判斷是否觸發危害,用語料對照跨科別醫師的標記驗證,結果跟專家相當甚至略勝。
- 用自動化工具取代人工調 prompt手動 prompt engineering 主觀又耗時,格式改一下就能讓 benchmark 差幾十個百分點,改用自動優化工具後,原本要幾天的流程壓到半小時到一小時,還能重現、留稽核軌跡。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | Jared Joselowitz 自我介紹背景,說明他在 Ufonia 科學團隊裡的工作,是在病人真正聽到 Dora 之前先證明它是安全的。 |
| 01:00 | 三道安全網不見了 | 病人身上沒辦法做 A/B test(分到較差版本不合倫理也可能違法)、電話說出口就收不回、模型在某個 benchmark 拿到的分數在事後審查時也不算數。 |
| 01:32 | Dora 是什麼、規模多大 | Dora 是打電話給病人做術後追蹤與術前確認的語音 agent,在英國 20 家醫院做過約 20 萬通真實臨床電話,合約要在兩年內擴大到百萬病人;美國也已在兩家診所上線,另簽了六家。 |
| 03:28 | 因此被當成醫療器材 | 現場示範一通白內障術後電話後點出,只要 Dora 會問診、給建議、答問題,就會被認定是醫療器材,得回答軟體做什麼、可能出什麼錯、如何確保不出錯這三個規管問題。 |
| 04:31 | 「上線看板再回滾」這套行不通 | 一般軟體靠小比例上線、看 dashboard、出包就回滾,但病人身上禁不起試錯:5% 的錯誤率換算就是成百上千人受害,電話已經講完,dashboard 亮紅燈時人已經受傷了。 |
| 06:07 | 借鏡自駕車,建了 Matrix 模擬框架 | 比照自駕車先跑幾百萬英里模擬才真的載人,Ufonia 建了 Matrix:用 LLM 扮演病人(Patbot)跟 Dora 對話,在特定臨床情境下產生模擬對話,取代找真人演員測試。 |
| 08:12 | 找真病人驗證模擬夠不夠真 | 找真實病人比較「真人醫病對話」與「Dora 對 Patbot」的對話,四組裡有三組多數人反而覺得模擬對話比較真實,但也發現沒有唯一標準的「真實病人」,得模擬各種不同人格與說話習慣。 |
| 09:31 | 自動判官判斷有沒有出包 | 模擬對話量太大,人工看不完也不是臨床專業,於是用另一個模型依預期行為與危害情境判定通過或失敗,對照跨科別醫師的標記驗證,結果跟專家相當甚至略勝。 |
| 11:56 | 用自動化工具取代人工調 prompt | 手動 prompt engineering 很主觀又耗時,光是換個格式就能讓 benchmark 差幾十個百分點;改用自動優化工具後,設好指標讓強模型檢討失敗案例改寫 prompt,原本要幾天的流程壓到半小時到一小時。 |
| 14:33 | 新的循環取代舊的上線流程 | 真實通話資料加上合成的邊緣案例(罕見症狀、轉錄錯誤)餵進優化流程產生新 prompt,再過模擬這道安全關卡,過關才分階段上線,每次上線又產生更多資料,系統因此持續變好。 |
| 17:27 | 換到語音場景,框架不用重來 | 進入語音模態後多了打斷、搶話這類新危害,較弱的模型常在安全提醒講到一半被打斷就整段忘記,但同一套「黑箱測試、記錄危害、模擬加判官」的做法不用重做,只是換個模態繼續套用。 |
值得記的話
名詞與人物
| Dora | Ufonia 打造的臨床語音對話 agent,負責打電話給病人做術後追蹤、術前確認等臨床對話。 |
|---|---|
| Ufonia | Jared 任職的公司,Dora 背後負責安全與評估體系的科學團隊所在。 |
| Matrix | Ufonia 建立的模擬框架,讓 LLM 扮演病人跟 Dora 對話,在真正碰到病人前先找出可能的危害。 |
| Patbot | Matrix 框架裡扮演病人的 LLM,依設定的臨床情境跟 Dora 對話,產生模擬對話紀錄。 |
| PPI study(Patient and Public Involvement) | 找真實病人參與、比較真人對話與模擬對話哪個更真實的研究方法。 |
| BevJudge | 團隊自建的評審模型,讀模擬對話與一組預期行為,判斷有沒有觸發預先定義的危害,產出通過或失敗的結構化結果。 |
| medical device(醫療器材) | 只要產品會問診、給建議、答問題,就會被認定為醫療器材,須證明其安全性並接受法規審查。 |
| sensitivity(敏感度) | 這裡指有沒有漏掉真正的危害,Ufonia 寧可多抓一些假警報,也不要漏掉真正的紅旗症狀。 |
延伸
- 講者提到 Matrix 框架的論文已經放上 arXiv。
- Matrix 與自動判官這套「黑箱測試、記錄危害、模擬加判官」的做法,後來也被搬到語音模態,用來抓打斷、搶話等新出現的危害。