全部場數

002 · 臨床標註校準 AI 教練安全分寸

SonderMind 團隊說明如何用雙層 guardrail 架構與臨床人員標註的 eval,替心理健康 AI 教練在安全與可用之間抓對分寸。

2026-07-2521:17Akele Reed、Dave Revere(SonderMind)醫療評估安全看原片

原標題:Evals-Driven Development for a Mental Health AI Coach — Akele Reed & Dave Revere, SonderMind

重點摘要

  • 架構把安全放兩端輸入、輸出兩層 guardrail 包夾核心的 SonderCore,各自用獨立的 LLM 判斷是否要介入,模組化設計讓核心能持續迭代,又不必每次重新驗證整套安全機制。
  • 抓對而非抓多一般 LLM 的 guardrail 太保守,誤觸發對正在求助的使用者來說像被甩門;SonderMind 用主動危機、過去創傷揭露、一般情緒議題三種情境,校準出不同的介入方式。
  • 臨床人員定義對錯對話會被追蹤下來,交由臨床人員標註「應有的處置」,轉成含期望結果與分類的 eval,之後每次模型或 guardrail 異動都要通過這些由人定義的判準,而不是系統自行認定。
  • 也要防止過度緊張除了不能漏接風險,也要避免系統比人還容易恐慌;做法是讓臨床專家定義「正確」、用具體問題檢驗每個標註情境,並把它們變成上線前必須通過的關卡。
  • 開源共用的安全基準認為這類挑戰不是單一公司獨有,因此釋出 200 筆輸入 guardrail 與 100 筆輸出 guardrail 情境供業界參考,但強調這不能取代自己建立學習迴圈。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場與警語Akele Reed、Dave Revere(SonderMind)說明主題是安全打造心理健康 AI 教練,並提醒內容涉及自殺、自傷、家暴等主題。
00:30公司背景SonderMind 媒合個案與全美的治療師、精神科醫師,已服務逾百萬人,並與 Headspace、Aetna、Anthem 等機構合作。
01:08產品定位推出臨床導向的 AI 教練 Sonder,鎖定一般 LLM 覆蓋不到的照護缺口;APA 調查顯示 77% 心理師觀察到病人已用 AI 求助。
02:24功能與情境Sonder 是全天候的對話(含語音)AI,協助使用者反思生活、追蹤目標、練習情緒穩定技巧,也能在療程前後提供支持。
03:00系統架構Sonder 由輸入、輸出兩層 guardrail 包夾核心的 SonderCore,各自用獨立 LLM 判斷是否介入,模組化讓核心能迭代又不犧牲安全。
05:57校準與分級一般 LLM 的 guardrail 太保守,誤觸發像對求助者甩門;用主動危機、過去創傷、一般情緒議題三種情境,示範不同的介入分級。
09:15話語背後的訊息Dave Revere 以兒子回「我很好」為例,說明話語背後常有另一層意思,單靠一次性 eval gate 無法保證安全,需要持續學習的迴圈。
10:44隱含風險案例以一句看似平常、實則暗藏自傷風險的話為例,說明 regex、冗長 prompt 規則、通用審核 API 都抓不到這種話中話,案例來自臨床人員的真實經驗。
11:35判斷變測試對話被追蹤下來,交由臨床人員標註「應有的處置」,轉成含期望結果與分類的 eval;之後每次模型或 guardrail 異動都要通過這些判準。
13:46防止過度校準為避免系統比人還緊張,做法是讓臨床專家定義「正確」、用具體問題檢驗標註情境,並把它們變成上線前必須通過的關卡,而不追求滿分的 benchmark。
15:57開源資料集認為這類挑戰不是單一公司獨有,開源 200 筆輸入 guardrail 與 100 筆輸出 guardrail 情境,但強調不能取代自己建立學習迴圈。
18:42問答時間聽眾問如何處理 Anthropic、OpenAI 等底層模型內建、過度保守的 guardrail;SonderMind 從第一天就關掉這些機制、改用自建的一套。

值得記的話

名詞與人物

SonderMind媒合個案與全美治療師、精神科醫師的心理健康照護公司,這場的講者任職於此。
SonderSonderMind 打造的臨床導向 AI 心理健康教練,支援對話與語音互動。
SonderCoreSonder 背後的核心對話引擎,被輸入、輸出兩層 guardrail 包夾保護。
guardrail偵測使用者訊息或 AI 回覆是否有安全疑慮、必要時介入對話的機制,這場分為輸入與輸出兩層。
LLM-as-judge用另一個獨立的 LLM 判斷 guardrail 該不該觸發,比把規則寫進單一大 prompt 更難被繞過。
typed eval把臨床人員對某段對話的標註,轉成含期望結果、期望觀察、分類等欄位的結構化測試案例。
American Psychological Association (APA)這場引用其心理師執業調查數據的機構。
Caroline ColleySonderMind 的臨床人員,講者特別致謝,是校準 guardrail 判準的關鍵角色。

延伸

  • SonderMind 開源的 200 筆輸入 guardrail、100 筆輸出 guardrail 資料集,這場提到可用投影片上的 QR code 取得,但沒有進一步說明存取方式或授權條件。
  • 提到有「annotation extraction script」能觸發並整理待討論的案例報告,但沒有展開技術實作細節。
  • 問答提到 Anthropic、OpenAI 等前沿模型內建的 guardrail 過度保守,SonderMind 第一天就關閉改用自建機制,但沒有說明技術上如何關閉或替換。