002 · 臨床標註校準 AI 教練安全分寸
SonderMind 團隊說明如何用雙層 guardrail 架構與臨床人員標註的 eval,替心理健康 AI 教練在安全與可用之間抓對分寸。
原標題:Evals-Driven Development for a Mental Health AI Coach — Akele Reed & Dave Revere, SonderMind
重點摘要
- 架構把安全放兩端輸入、輸出兩層 guardrail 包夾核心的 SonderCore,各自用獨立的 LLM 判斷是否要介入,模組化設計讓核心能持續迭代,又不必每次重新驗證整套安全機制。
- 抓對而非抓多一般 LLM 的 guardrail 太保守,誤觸發對正在求助的使用者來說像被甩門;SonderMind 用主動危機、過去創傷揭露、一般情緒議題三種情境,校準出不同的介入方式。
- 臨床人員定義對錯對話會被追蹤下來,交由臨床人員標註「應有的處置」,轉成含期望結果與分類的 eval,之後每次模型或 guardrail 異動都要通過這些由人定義的判準,而不是系統自行認定。
- 也要防止過度緊張除了不能漏接風險,也要避免系統比人還容易恐慌;做法是讓臨床專家定義「正確」、用具體問題檢驗每個標註情境,並把它們變成上線前必須通過的關卡。
- 開源共用的安全基準認為這類挑戰不是單一公司獨有,因此釋出 200 筆輸入 guardrail 與 100 筆輸出 guardrail 情境供業界參考,但強調這不能取代自己建立學習迴圈。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場與警語 | Akele Reed、Dave Revere(SonderMind)說明主題是安全打造心理健康 AI 教練,並提醒內容涉及自殺、自傷、家暴等主題。 |
| 00:30 | 公司背景 | SonderMind 媒合個案與全美的治療師、精神科醫師,已服務逾百萬人,並與 Headspace、Aetna、Anthem 等機構合作。 |
| 01:08 | 產品定位 | 推出臨床導向的 AI 教練 Sonder,鎖定一般 LLM 覆蓋不到的照護缺口;APA 調查顯示 77% 心理師觀察到病人已用 AI 求助。 |
| 02:24 | 功能與情境 | Sonder 是全天候的對話(含語音)AI,協助使用者反思生活、追蹤目標、練習情緒穩定技巧,也能在療程前後提供支持。 |
| 03:00 | 系統架構 | Sonder 由輸入、輸出兩層 guardrail 包夾核心的 SonderCore,各自用獨立 LLM 判斷是否介入,模組化讓核心能迭代又不犧牲安全。 |
| 05:57 | 校準與分級 | 一般 LLM 的 guardrail 太保守,誤觸發像對求助者甩門;用主動危機、過去創傷、一般情緒議題三種情境,示範不同的介入分級。 |
| 09:15 | 話語背後的訊息 | Dave Revere 以兒子回「我很好」為例,說明話語背後常有另一層意思,單靠一次性 eval gate 無法保證安全,需要持續學習的迴圈。 |
| 10:44 | 隱含風險案例 | 以一句看似平常、實則暗藏自傷風險的話為例,說明 regex、冗長 prompt 規則、通用審核 API 都抓不到這種話中話,案例來自臨床人員的真實經驗。 |
| 11:35 | 判斷變測試 | 對話被追蹤下來,交由臨床人員標註「應有的處置」,轉成含期望結果與分類的 eval;之後每次模型或 guardrail 異動都要通過這些判準。 |
| 13:46 | 防止過度校準 | 為避免系統比人還緊張,做法是讓臨床專家定義「正確」、用具體問題檢驗標註情境,並把它們變成上線前必須通過的關卡,而不追求滿分的 benchmark。 |
| 15:57 | 開源資料集 | 認為這類挑戰不是單一公司獨有,開源 200 筆輸入 guardrail 與 100 筆輸出 guardrail 情境,但強調不能取代自己建立學習迴圈。 |
| 18:42 | 問答時間 | 聽眾問如何處理 Anthropic、OpenAI 等底層模型內建、過度保守的 guardrail;SonderMind 從第一天就關掉這些機制、改用自建的一套。 |
值得記的話
名詞與人物
| SonderMind | 媒合個案與全美治療師、精神科醫師的心理健康照護公司,這場的講者任職於此。 |
|---|---|
| Sonder | SonderMind 打造的臨床導向 AI 心理健康教練,支援對話與語音互動。 |
| SonderCore | Sonder 背後的核心對話引擎,被輸入、輸出兩層 guardrail 包夾保護。 |
| guardrail | 偵測使用者訊息或 AI 回覆是否有安全疑慮、必要時介入對話的機制,這場分為輸入與輸出兩層。 |
| LLM-as-judge | 用另一個獨立的 LLM 判斷 guardrail 該不該觸發,比把規則寫進單一大 prompt 更難被繞過。 |
| typed eval | 把臨床人員對某段對話的標註,轉成含期望結果、期望觀察、分類等欄位的結構化測試案例。 |
| American Psychological Association (APA) | 這場引用其心理師執業調查數據的機構。 |
| Caroline Colley | SonderMind 的臨床人員,講者特別致謝,是校準 guardrail 判準的關鍵角色。 |
延伸
- SonderMind 開源的 200 筆輸入 guardrail、100 筆輸出 guardrail 資料集,這場提到可用投影片上的 QR code 取得,但沒有進一步說明存取方式或授權條件。
- 提到有「annotation extraction script」能觸發並整理待討論的案例報告,但沒有展開技術實作細節。
- 問答提到 Anthropic、OpenAI 等前沿模型內建的 guardrail 過度保守,SonderMind 第一天就關閉改用自建機制,但沒有說明技術上如何關閉或替換。