全部場數

010 · Dora 上線前的安全證據

打電話問診的臨床 AI Dora,不能拿病人做 A/B test,只能靠模擬與自動判官一步步換來上線的證據。

2026-08-1919:14Jared Joselowitz(Ufonia,Research Engineer)醫療評估安全看原片

原標題:Shipping AI to a Million Patients Without an A/B Test — Jared Joselowitz, Ufonia

重點摘要

  • Dora 是什麼、規模多大Ufonia 的 Dora 是打電話給病人做術後追蹤、術前確認的語音 agent,在英國 20 家醫院做過約 20 萬通真實臨床電話,合約要在兩年內擴大到百萬病人;美國也已在兩家診所上線,另簽了六家。
  • 病人身上沒辦法 A/B test把病人分到較差版本不合倫理也可能違法,電話一旦說出口就收不回,模型在某個 benchmark 拿到的分數在事後審查時也不算數,這三個限制讓一般軟體的上線做法失靈。
  • 借鏡自駕車,建了 Matrix 模擬框架比照自駕車先跑幾百萬英里模擬才真的載人,Ufonia 用 LLM 扮演病人(Patbot),在特定臨床情境下跟 Dora 對話產生模擬對話,取代找真人演員做測試。
  • 找真病人驗證模擬夠不夠真把「真人醫病對話」跟「Dora 對 Patbot」的對話放在一起給病人比較,四組裡有三組多數人反而覺得模擬對話比較真實,但也發現沒有唯一標準的「真實病人」,得模擬各種不同人格。
  • 自動判官取代人工看對話模擬對話量太大,人工看不完也不是臨床專業,於是另訓練一個模型判斷是否觸發危害,用語料對照跨科別醫師的標記驗證,結果跟專家相當甚至略勝。
  • 用自動化工具取代人工調 prompt手動 prompt engineering 主觀又耗時,格式改一下就能讓 benchmark 差幾十個百分點,改用自動優化工具後,原本要幾天的流程壓到半小時到一小時,還能重現、留稽核軌跡。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Jared Joselowitz 自我介紹背景,說明他在 Ufonia 科學團隊裡的工作,是在病人真正聽到 Dora 之前先證明它是安全的。
01:00三道安全網不見了病人身上沒辦法做 A/B test(分到較差版本不合倫理也可能違法)、電話說出口就收不回、模型在某個 benchmark 拿到的分數在事後審查時也不算數。
01:32Dora 是什麼、規模多大Dora 是打電話給病人做術後追蹤與術前確認的語音 agent,在英國 20 家醫院做過約 20 萬通真實臨床電話,合約要在兩年內擴大到百萬病人;美國也已在兩家診所上線,另簽了六家。
03:28因此被當成醫療器材現場示範一通白內障術後電話後點出,只要 Dora 會問診、給建議、答問題,就會被認定是醫療器材,得回答軟體做什麼、可能出什麼錯、如何確保不出錯這三個規管問題。
04:31「上線看板再回滾」這套行不通一般軟體靠小比例上線、看 dashboard、出包就回滾,但病人身上禁不起試錯:5% 的錯誤率換算就是成百上千人受害,電話已經講完,dashboard 亮紅燈時人已經受傷了。
06:07借鏡自駕車,建了 Matrix 模擬框架比照自駕車先跑幾百萬英里模擬才真的載人,Ufonia 建了 Matrix:用 LLM 扮演病人(Patbot)跟 Dora 對話,在特定臨床情境下產生模擬對話,取代找真人演員測試。
08:12找真病人驗證模擬夠不夠真找真實病人比較「真人醫病對話」與「Dora 對 Patbot」的對話,四組裡有三組多數人反而覺得模擬對話比較真實,但也發現沒有唯一標準的「真實病人」,得模擬各種不同人格與說話習慣。
09:31自動判官判斷有沒有出包模擬對話量太大,人工看不完也不是臨床專業,於是用另一個模型依預期行為與危害情境判定通過或失敗,對照跨科別醫師的標記驗證,結果跟專家相當甚至略勝。
11:56用自動化工具取代人工調 prompt手動 prompt engineering 很主觀又耗時,光是換個格式就能讓 benchmark 差幾十個百分點;改用自動優化工具後,設好指標讓強模型檢討失敗案例改寫 prompt,原本要幾天的流程壓到半小時到一小時。
14:33新的循環取代舊的上線流程真實通話資料加上合成的邊緣案例(罕見症狀、轉錄錯誤)餵進優化流程產生新 prompt,再過模擬這道安全關卡,過關才分階段上線,每次上線又產生更多資料,系統因此持續變好。
17:27換到語音場景,框架不用重來進入語音模態後多了打斷、搶話這類新危害,較弱的模型常在安全提醒講到一半被打斷就整段忘記,但同一套「黑箱測試、記錄危害、模擬加判官」的做法不用重做,只是換個模態繼續套用。

值得記的話

名詞與人物

DoraUfonia 打造的臨床語音對話 agent,負責打電話給病人做術後追蹤、術前確認等臨床對話。
UfoniaJared 任職的公司,Dora 背後負責安全與評估體系的科學團隊所在。
MatrixUfonia 建立的模擬框架,讓 LLM 扮演病人跟 Dora 對話,在真正碰到病人前先找出可能的危害。
PatbotMatrix 框架裡扮演病人的 LLM,依設定的臨床情境跟 Dora 對話,產生模擬對話紀錄。
PPI study(Patient and Public Involvement)找真實病人參與、比較真人對話與模擬對話哪個更真實的研究方法。
BevJudge團隊自建的評審模型,讀模擬對話與一組預期行為,判斷有沒有觸發預先定義的危害,產出通過或失敗的結構化結果。
medical device(醫療器材)只要產品會問診、給建議、答問題,就會被認定為醫療器材,須證明其安全性並接受法規審查。
sensitivity(敏感度)這裡指有沒有漏掉真正的危害,Ufonia 寧可多抓一些假警報,也不要漏掉真正的紅旗症狀。

延伸

  • 講者提到 Matrix 框架的論文已經放上 arXiv。
  • Matrix 與自動判官這套「黑箱測試、記錄危害、模擬加判官」的做法,後來也被搬到語音模態,用來抓打斷、搶話等新出現的危害。