全部場數

007 · 健康 AI 上線前的護欄設計

Hinge Health 的 AI 負責人整理會員健康 AI 上線前該有的三層架構防線,以及架構撐不住時該怎麼做決定。

2026-08-1921:49Rashi Agrawal(Hinge Health,AI 與 ML 負責人)醫療評估安全看原片

原標題:Guardrails First: Engineering Member-Facing Health AI — Rashi Agrawal, Hinge Health

重點摘要

  • 健康 AI 已經出包講者用「鹽換成 sodium bromide 中毒」「Mount Sinai 誤判測試」「ECRI 頭號風險排名」三個例子,說明健康 AI 的安全問題不是假設,而是正在發生的事。
  • PHI 要在架構層面就消失不是等寫進儀表板才遮蔽,而是在資料進 pipeline 那一刻就先剝除;正式與非正式環境完全隔離,存取權限依角色與地區分流。
  • 不可逆的判斷交給 code,不交給模型緊急升級、對話分流、身分驗證這類決定必須放在模型之上的確定性 code 層,因為連前沿模型自己公布的權限階層裡,user 以上的每一層都可能被 prompt injection 蓋過。
  • 安全評估要一直開著除了上線前的測試,還要靠自動化 judge、會員的按讚/倒讚回饋、人工抽查高風險對話三種訊號持續監看線上對話,瓶頸永遠是有沒有足夠的人去讀訊號。
  • 架構撐不住時,靠五條規則做決定嚴重度看最壞情況,例如影響 100% 使用者的輕微 bug,嚴重度還是比不上只在 0.1% 情況下會造成嚴重傷害的 bug;拿不準就選比較安全的那個錯誤;校準組織實際容忍的風險,而不是嘴上說的風險。
  • 先確認訊號本身沒錯,再去動東西judge 分數異常時,要先判斷是 judge 判斷錯了還是 agent 真的錯了,再決定修哪一邊,而不是急著去改 prompt。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場自我介紹講者 Rashi Agrawal 自我介紹,說明將從實作角度談 Hinge Health 怎麼替會員健康 AI 設計護欄。
00:45健康 AI 的現況有 4000 萬人已經在用前沿模型替自己的健康問題分診;緊接著是一名健康男性照 AI 建議把鹽換成 sodium bromide,連續吃 3 個月,血中溴化物濃度飆到安全值 200 倍,住院 3 週的真實案例。
01:32更多警訊案例Mount Sinai 對消費級健康 AI 做的第一個獨立安全測試,發現它有 50% 的機率把緊急狀況誤判成不用馬上就醫;ECRI 把 AI chatbot 誤用列為 2026 年頭號醫療科技風險。
02:39三個核心前提講者提出三個前提:安全問題多半是架構決策而非模型失靈、確定性規則要放在模型之上、安全是持續評估而非上線前的一次性關卡。
03:30第一層:保護 PHIPHI 要在資料進 pipeline 那一刻就先剝除,而不是等寫進儀表板才遮蔽;正式與非正式環境完全隔離,存取權限依角色與地區分流。
05:45第二層:Code 優先不可逆的判斷不能交給機率性的模型;前沿模型自己公布的權限階層裡,user 以上的每一層都可能被 prompt injection 蓋過,所以確定性的 code 層要跑在模型之前。
07:58三個確定性實例偵測到自傷意念要直接轉 911 或 988、判斷這輪對話該交給哪個能力、存取會員資料前先驗證身分,三者都要走確定性路徑,模型不能有投票權。
09:30第三層:持續評估評估不是上線前的檢查清單,而是即時替線上對話打分;訊號來自自動化 judge、會員的按讚/倒讚回饋、人工抽查高風險對話,瓶頸是有沒有足夠的人讀訊號並採取行動。
12:48五方利害衝突舉例說明上線前 5 天,臨床、法務、法遵、產品、工程五個角色各自看到不同風險,彼此意見不合,帶出後面的決策規則。
14:01五條決策規則嚴重度看最壞情況而非平均,例如影響 100% 使用者的輕微 bug,嚴重度比不上只在 0.1% 案例中會造成嚴重傷害的 bug;嚴重度跟修復難易度無關;拿不準就選較安全的錯誤;校準組織實際容忍的風險而非嘴上說的;人力才是真正的限制。
17:39先查 Judge 對錯用一個 clinical accuracy judge 分數從 4.9 掉到 4.5 的例子說明:分數異常時要先確認是 judge 判斷錯了還是 agent 真的錯了,再決定要修哪一邊。
20:18總結六要點架構面是別用政策做的事就用架構做、別用 prompt 做的事就用 code 做、別用關卡做的事就用監控做;決策面是照最壞情況評分、預設選較安全的錯誤、校準組織實際的風險容忍度並保留人在迴圈中。

值得記的話

名詞與人物

PHIProtected Health Information,受法規保護的病人健康資料;這場演講的重點之一,就是怎麼在架構層面讓它從一開始就不落地。
HIPAA美國的醫療資料隱私法規,講者把它列為設計架構時就要先納入的合規底線,而不是事後補上去的檢查項目。
Good Machine Learning PracticeFDA 提出的機器學習醫療器材開發原則,演講中和 HIPAA、州法一起被列為架構必須對齊的規範。
ECRI講者引用的病人安全組織,把 AI chatbot 誤用列為 2026 年頭號醫療科技風險。
988美國的自殺/危機專線號碼,演講中以「偵測到自傷意念要直接轉 911 或 988」當作確定性路由的例子。
Abridge前一場演講提到的公司,這場演講開場只帶過一句,沒有進一步說明它做什麼。
Texas TRAIGA講者點名的德州州級 AI 法規,和 HIPAA、FDA 的 Good Machine Learning Practice 並列,屬於一開始就要納入架構的合規要求,而不是事後補上。

延伸

  • 演講中提到的 Texas TRAIGA 之類州級法規,只列了名字帶過,沒有進一步說明內容是什麼。
  • 「Fast followers are committed debt, not backlog.」這句話只出現一次,沒有展開解釋。
  • 開場提到前一場演講的 Abridge,是同一場次前後銜接的一句話,這場沒有再回頭談它。