003 · 兩億通電話練出的問診語音架構
Hippocratic AI 用同時運作 31 個模型的語音代理主動致電病患問診,兩億通對話下仍維持零重大安全事故。
原標題:200 Million Patient Interactions Later — Vivek Muppalla, Hippocratic AI
重點摘要
- 兩億通對話撐起的臨床代理Hippocratic AI 打造會主動致電病患的 AI care manager,做用藥核對、生命徵象確認、停藥偵測,必要時轉介護理師,累積超過兩億次臨床互動,零重大安全事故。
- 從稀缺走向普及醫療長期只能靠 triage 篩出最需要照顧的少數人,講者認為 AI 對話的成本已經夠低、也夠臨床安全,才有機會把「只打給最重的病人」變成「打給每一個人」。
- 快與準的取捨被拆解反應快的通用模型不夠臨床精準,精準的模型又慢到無法即時對話,Hippocratic AI 因此決定由下而上打造自己的語音技術堆疊,把每次省下的延遲拿去換更多智慧,形成互相加乘的循環。
- Polaris 架構分工聽、想、說三段聽的一端處理背景雜音與雙語切換;中間的大腦同時跑 31 個模型,一個主模型搭配 30 個各司其職的專家模型,各自先判斷需不需要開口再交給主模型裁決;輸出端負責語音與病歷紀錄回寫。
- 語音辨識自己微調到懂臨床脈絡把開源的 Whisper V3 large turbo 微調成 encoder,額外餵入對話脈絡與領域知識,把醫療用詞辨識錯誤率壓低超過五成,速度也比同類系統快三倍。
- 用人類醫療分級的尺標評分自己不只看模型輸出對不對,而是套用 correctness、no harm、minor harm、severe harm、death 這套人類醫療傷害分級表打分,五代 Polaris 迭代後「no harm」達 99.89%,並自建 Heart 評測基準衡量對話的同理心。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 講者 Vivek Muppalla 說明自己在 Hippocratic AI 負責 AI engineering,這場要介紹會主動致電病患問診的產品,目前已促成逾兩億通對話。 |
| 01:00 | 醫療資源的稀缺與轉機 | 醫療史上一直因人力、時間、金錢不足而只能做 triage,如今 AI 對話成本夠低、也夠臨床安全,稀缺的算式終於能翻轉。 |
| 02:10 | 三大原則與規模數字 | 產品建立在「do no harm、patient first、access for all」誓詞上,累積兩億次臨床互動、零重大安全事故、進駐逾 60 家醫療系統,病患滿意度 8.5 分(滿分 10)。 |
| 02:45 | 實際對話錄音展示 | 播放 AI care manager 與病患的真實通話片段,涵蓋藥名核對、生命徵象複述確認、停藥偵測,以及偵測到呼吸急促等狀況時即時轉介護理師。 |
| 05:18 | 智慧與延遲的兩難 | 反應快的通用模型不夠臨床精準,精準的模型又慢到無法即時對話,Hippocratic AI 因此決定從頭打造垂直整合的語音技術堆疊。 |
| 07:49 | Polaris 星座架構登場 | 架構左邊負責聽、中間是同時運作 31 個模型的大腦、右邊負責回應,整個來回都必須夠快才能撐起雙向對話。 |
| 09:27 | 語音辨識拆解重練 | 現實對話環境吵雜、藥名發音又容易被聽錯,團隊把 Whisper V3 large turbo 微調成 decoder-only 的 audio LLM,額外餵入對話脈絡與領域知識,把醫療用詞辨識錯誤率壓低超過五成。 |
| 15:04 | 推論端的三項關鍵優化 | 用 4-bit 量化壓縮運算、speculative decoding 加速產生 token、KV cache 壓縮讓長對話維持高命中率,三者合力持續壓低延遲又不犧牲品質。 |
| 16:26 | 用統計抓 1% 的錯誤率 | 以排程用例為例,一天一萬通電話,1% 錯誤代表一百人被排錯門診;要有九成九把握抓到這 1%,得跑上百次測試,因此結合逾七千位受訓臨床人員與合成資料做持續評測。 |
| 17:50 | 比照人類醫療分級打分 | 用 correctness 到 death 的人類醫療傷害分級來評分模型輸出,五代 Polaris 迭代後「no harm」達 99.89%,同一把尺量人類約 81%。 |
| 18:42 | 同理心也要有評測基準 | 光是安全還不夠,團隊發現市面缺乏衡量 AI 對話同理心的基準,於是自建了 Heart 並公開論文,確保系統既安全又讓病患願意敞開心房。 |
值得記的話
名詞與人物
| Hippocratic AI | 講者任職的公司,打造能主動致電病患進行臨床對話的 AI care manager |
|---|---|
| Vivek Muppalla | 本場講者,在 Hippocratic AI 負責 AI engineering |
| Polaris | Hippocratic AI 語音代理架構的代號,講者稱為「星座」(constellation)架構,分聽、推理、回應三段 |
| Whisper V3 large turbo | 開源語音辨識模型,Hippocratic AI 拿它微調成自家 ASR 的 encoder |
| speculative decoding | 先用小模型預測 token、再由主模型一次驗證的解碼加速技巧 |
| KV cache | 對話過程中暫存的注意力鍵值,做壓縮與保溫可加速長對話的推論 |
| Heart | Hippocratic AI 自建、用來衡量 AI 對話同理心程度的評測基準,論文已公開 |
延伸
- 簡報提到業界常見的語音系統做法,才講到「用一組模型組成 ensemble」就轉場,另外的做法沒有在台上說明。
- Heart 這份用來衡量對話同理心的評測基準,只提到論文已公開,沒有在台上說明評分方法或分數。
- 公司內部設有 agent deployment residency 與 AI residency 兩個訓練管道,但沒有進一步說明內容或申請門檻。