007 · 健康 AI 上線前的護欄設計
Hinge Health 的 AI 負責人整理會員健康 AI 上線前該有的三層架構防線,以及架構撐不住時該怎麼做決定。
原標題:Guardrails First: Engineering Member-Facing Health AI — Rashi Agrawal, Hinge Health
重點摘要
- 健康 AI 已經出包講者用「鹽換成 sodium bromide 中毒」「Mount Sinai 誤判測試」「ECRI 頭號風險排名」三個例子,說明健康 AI 的安全問題不是假設,而是正在發生的事。
- PHI 要在架構層面就消失不是等寫進儀表板才遮蔽,而是在資料進 pipeline 那一刻就先剝除;正式與非正式環境完全隔離,存取權限依角色與地區分流。
- 不可逆的判斷交給 code,不交給模型緊急升級、對話分流、身分驗證這類決定必須放在模型之上的確定性 code 層,因為連前沿模型自己公布的權限階層裡,user 以上的每一層都可能被 prompt injection 蓋過。
- 安全評估要一直開著除了上線前的測試,還要靠自動化 judge、會員的按讚/倒讚回饋、人工抽查高風險對話三種訊號持續監看線上對話,瓶頸永遠是有沒有足夠的人去讀訊號。
- 架構撐不住時,靠五條規則做決定嚴重度看最壞情況,例如影響 100% 使用者的輕微 bug,嚴重度還是比不上只在 0.1% 情況下會造成嚴重傷害的 bug;拿不準就選比較安全的那個錯誤;校準組織實際容忍的風險,而不是嘴上說的風險。
- 先確認訊號本身沒錯,再去動東西judge 分數異常時,要先判斷是 judge 判斷錯了還是 agent 真的錯了,再決定修哪一邊,而不是急著去改 prompt。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場自我介紹 | 講者 Rashi Agrawal 自我介紹,說明將從實作角度談 Hinge Health 怎麼替會員健康 AI 設計護欄。 |
| 00:45 | 健康 AI 的現況 | 有 4000 萬人已經在用前沿模型替自己的健康問題分診;緊接著是一名健康男性照 AI 建議把鹽換成 sodium bromide,連續吃 3 個月,血中溴化物濃度飆到安全值 200 倍,住院 3 週的真實案例。 |
| 01:32 | 更多警訊案例 | Mount Sinai 對消費級健康 AI 做的第一個獨立安全測試,發現它有 50% 的機率把緊急狀況誤判成不用馬上就醫;ECRI 把 AI chatbot 誤用列為 2026 年頭號醫療科技風險。 |
| 02:39 | 三個核心前提 | 講者提出三個前提:安全問題多半是架構決策而非模型失靈、確定性規則要放在模型之上、安全是持續評估而非上線前的一次性關卡。 |
| 03:30 | 第一層:保護 PHI | PHI 要在資料進 pipeline 那一刻就先剝除,而不是等寫進儀表板才遮蔽;正式與非正式環境完全隔離,存取權限依角色與地區分流。 |
| 05:45 | 第二層:Code 優先 | 不可逆的判斷不能交給機率性的模型;前沿模型自己公布的權限階層裡,user 以上的每一層都可能被 prompt injection 蓋過,所以確定性的 code 層要跑在模型之前。 |
| 07:58 | 三個確定性實例 | 偵測到自傷意念要直接轉 911 或 988、判斷這輪對話該交給哪個能力、存取會員資料前先驗證身分,三者都要走確定性路徑,模型不能有投票權。 |
| 09:30 | 第三層:持續評估 | 評估不是上線前的檢查清單,而是即時替線上對話打分;訊號來自自動化 judge、會員的按讚/倒讚回饋、人工抽查高風險對話,瓶頸是有沒有足夠的人讀訊號並採取行動。 |
| 12:48 | 五方利害衝突 | 舉例說明上線前 5 天,臨床、法務、法遵、產品、工程五個角色各自看到不同風險,彼此意見不合,帶出後面的決策規則。 |
| 14:01 | 五條決策規則 | 嚴重度看最壞情況而非平均,例如影響 100% 使用者的輕微 bug,嚴重度比不上只在 0.1% 案例中會造成嚴重傷害的 bug;嚴重度跟修復難易度無關;拿不準就選較安全的錯誤;校準組織實際容忍的風險而非嘴上說的;人力才是真正的限制。 |
| 17:39 | 先查 Judge 對錯 | 用一個 clinical accuracy judge 分數從 4.9 掉到 4.5 的例子說明:分數異常時要先確認是 judge 判斷錯了還是 agent 真的錯了,再決定要修哪一邊。 |
| 20:18 | 總結六要點 | 架構面是別用政策做的事就用架構做、別用 prompt 做的事就用 code 做、別用關卡做的事就用監控做;決策面是照最壞情況評分、預設選較安全的錯誤、校準組織實際的風險容忍度並保留人在迴圈中。 |
值得記的話
名詞與人物
| PHI | Protected Health Information,受法規保護的病人健康資料;這場演講的重點之一,就是怎麼在架構層面讓它從一開始就不落地。 |
|---|---|
| HIPAA | 美國的醫療資料隱私法規,講者把它列為設計架構時就要先納入的合規底線,而不是事後補上去的檢查項目。 |
| Good Machine Learning Practice | FDA 提出的機器學習醫療器材開發原則,演講中和 HIPAA、州法一起被列為架構必須對齊的規範。 |
| ECRI | 講者引用的病人安全組織,把 AI chatbot 誤用列為 2026 年頭號醫療科技風險。 |
| 988 | 美國的自殺/危機專線號碼,演講中以「偵測到自傷意念要直接轉 911 或 988」當作確定性路由的例子。 |
| Abridge | 前一場演講提到的公司,這場演講開場只帶過一句,沒有進一步說明它做什麼。 |
| Texas TRAIGA | 講者點名的德州州級 AI 法規,和 HIPAA、FDA 的 Good Machine Learning Practice 並列,屬於一開始就要納入架構的合規要求,而不是事後補上。 |
延伸
- 演講中提到的 Texas TRAIGA 之類州級法規,只列了名字帶過,沒有進一步說明內容是什麼。
- 「Fast followers are committed debt, not backlog.」這句話只出現一次,沒有展開解釋。
- 開場提到前一場演講的 Abridge,是同一場次前後銜接的一句話,這場沒有再回頭談它。