全部場數

003 · 兩億通電話練出的問診語音架構

Hippocratic AI 用同時運作 31 個模型的語音代理主動致電病患問診,兩億通對話下仍維持零重大安全事故。

2026-08-1920:39Vivek Muppalla(Hippocratic AI,AI Engineering 負責人)醫療Agent安全看原片

原標題:200 Million Patient Interactions Later — Vivek Muppalla, Hippocratic AI

重點摘要

  • 兩億通對話撐起的臨床代理Hippocratic AI 打造會主動致電病患的 AI care manager,做用藥核對、生命徵象確認、停藥偵測,必要時轉介護理師,累積超過兩億次臨床互動,零重大安全事故。
  • 從稀缺走向普及醫療長期只能靠 triage 篩出最需要照顧的少數人,講者認為 AI 對話的成本已經夠低、也夠臨床安全,才有機會把「只打給最重的病人」變成「打給每一個人」。
  • 快與準的取捨被拆解反應快的通用模型不夠臨床精準,精準的模型又慢到無法即時對話,Hippocratic AI 因此決定由下而上打造自己的語音技術堆疊,把每次省下的延遲拿去換更多智慧,形成互相加乘的循環。
  • Polaris 架構分工聽、想、說三段聽的一端處理背景雜音與雙語切換;中間的大腦同時跑 31 個模型,一個主模型搭配 30 個各司其職的專家模型,各自先判斷需不需要開口再交給主模型裁決;輸出端負責語音與病歷紀錄回寫。
  • 語音辨識自己微調到懂臨床脈絡把開源的 Whisper V3 large turbo 微調成 encoder,額外餵入對話脈絡與領域知識,把醫療用詞辨識錯誤率壓低超過五成,速度也比同類系統快三倍。
  • 用人類醫療分級的尺標評分自己不只看模型輸出對不對,而是套用 correctness、no harm、minor harm、severe harm、death 這套人類醫療傷害分級表打分,五代 Polaris 迭代後「no harm」達 99.89%,並自建 Heart 評測基準衡量對話的同理心。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場講者 Vivek Muppalla 說明自己在 Hippocratic AI 負責 AI engineering,這場要介紹會主動致電病患問診的產品,目前已促成逾兩億通對話。
01:00醫療資源的稀缺與轉機醫療史上一直因人力、時間、金錢不足而只能做 triage,如今 AI 對話成本夠低、也夠臨床安全,稀缺的算式終於能翻轉。
02:10三大原則與規模數字產品建立在「do no harm、patient first、access for all」誓詞上,累積兩億次臨床互動、零重大安全事故、進駐逾 60 家醫療系統,病患滿意度 8.5 分(滿分 10)。
02:45實際對話錄音展示播放 AI care manager 與病患的真實通話片段,涵蓋藥名核對、生命徵象複述確認、停藥偵測,以及偵測到呼吸急促等狀況時即時轉介護理師。
05:18智慧與延遲的兩難反應快的通用模型不夠臨床精準,精準的模型又慢到無法即時對話,Hippocratic AI 因此決定從頭打造垂直整合的語音技術堆疊。
07:49Polaris 星座架構登場架構左邊負責聽、中間是同時運作 31 個模型的大腦、右邊負責回應,整個來回都必須夠快才能撐起雙向對話。
09:27語音辨識拆解重練現實對話環境吵雜、藥名發音又容易被聽錯,團隊把 Whisper V3 large turbo 微調成 decoder-only 的 audio LLM,額外餵入對話脈絡與領域知識,把醫療用詞辨識錯誤率壓低超過五成。
15:04推論端的三項關鍵優化用 4-bit 量化壓縮運算、speculative decoding 加速產生 token、KV cache 壓縮讓長對話維持高命中率,三者合力持續壓低延遲又不犧牲品質。
16:26用統計抓 1% 的錯誤率以排程用例為例,一天一萬通電話,1% 錯誤代表一百人被排錯門診;要有九成九把握抓到這 1%,得跑上百次測試,因此結合逾七千位受訓臨床人員與合成資料做持續評測。
17:50比照人類醫療分級打分用 correctness 到 death 的人類醫療傷害分級來評分模型輸出,五代 Polaris 迭代後「no harm」達 99.89%,同一把尺量人類約 81%。
18:42同理心也要有評測基準光是安全還不夠,團隊發現市面缺乏衡量 AI 對話同理心的基準,於是自建了 Heart 並公開論文,確保系統既安全又讓病患願意敞開心房。

值得記的話

名詞與人物

Hippocratic AI講者任職的公司,打造能主動致電病患進行臨床對話的 AI care manager
Vivek Muppalla本場講者,在 Hippocratic AI 負責 AI engineering
PolarisHippocratic AI 語音代理架構的代號,講者稱為「星座」(constellation)架構,分聽、推理、回應三段
Whisper V3 large turbo開源語音辨識模型,Hippocratic AI 拿它微調成自家 ASR 的 encoder
speculative decoding先用小模型預測 token、再由主模型一次驗證的解碼加速技巧
KV cache對話過程中暫存的注意力鍵值,做壓縮與保溫可加速長對話的推論
HeartHippocratic AI 自建、用來衡量 AI 對話同理心程度的評測基準,論文已公開

延伸

  • 簡報提到業界常見的語音系統做法,才講到「用一組模型組成 ensemble」就轉場,另外的做法沒有在台上說明。
  • Heart 這份用來衡量對話同理心的評測基準,只提到論文已公開,沒有在台上說明評分方法或分數。
  • 公司內部設有 agent deployment residency 與 AI residency 兩個訓練管道,但沒有進一步說明內容或申請門檻。