Evals-Driven Development for a Mental Health AI Coach — Akele Reed & Dave Revere, SonderMind
三句話摘要
設計兼具倫理和安全的心理健康 AI 教練:從臨床細微差別到開源評估框架。 在 AI 心理健康應用中,安全不能只靠技術規則達成,必須透過臨床醫生的判斷建構學習循環,且業界應共用評估基準線,而不是各自為政。 通用 LLM 護欄過度校準的困境
重點整理
重點- 1
通用 LLM 護欄過度校準的困境
- 2
一般大型語言模型的內建護欄往往過於保守,導致患者在脆弱時刻反而感到被拒絕和孤立。Sondermind 因此關閉了預設護欄,自建精準度更高的系統,目標是「精準觸發」而非「觸發越多越好」。
- 3
臨床細微差別無法被簡單規則捕捉
- 4
講者舉例「我打包了一個箱子,只是想體驗離開的感覺」——這句話可能表達隱含的自殺意圖,但純技術手段(詞彙黑名單、API 審核)無法偵測。必須由臨床醫生基於真實患者經驗來標註和教會系統。
- 5
學習循環的設計核心
- 6
臨床醫生對標註的對話進行「類型化評估」(輸入、預期輸出、觀察結果、後設資料),每次系統調整都必須根據這個評估集重新評分。勝利不在修復單一句子,而在於整個風險類別的正確處理。
- 7
假陽性 vs 假陰性的權衡選擇
- 8
Sondermind 接受更多假陽性(誤判危機)以避免假陰性(漏掉真實風險),同時透過臨床判斷定義「好」的標準,而非追求完美校準。
實用技巧與重點
乾貨- 公司背景
- Sondermind:心理健康護理配對平台
- 服務超過 100 萬人全國用戶
- 合作夥伴:Headspace、Etna、Anthem
- Sonder 功能
- 對話式 AI 教練,支援語音輸入
- 全天候 24/7 支持
- 循證接地練習(grounding exercises)
- 追蹤目標進度、準備治療課程、治療間隙支持
- 護欄架構
- 輸入護欄:檢查使用者訊息是否需干預
- 輸出護欄:檢查 AI 回應和對話進度
- 臨床統計
- 美國心理學會調查:77% 心理學家患者正使用 AI 獲得心理健康支持
- 開源資料集
- 200 個輸入護欄場景(clinically reviewed)
- 100 個輸出護欄場景
- 涵蓋心理健康各面向、單回合與多回合對話
- 標註方法
- 對話輸入 → 預期結果 → 預期觀察值 → 後設資料
- 回合索引:能重播對話至護欄應啟動時點
- 註釋提取腳本:自動分類並產生報告
結論
結論“在 AI 心理健康應用中,安全不能只靠技術規則達成,必須透過臨床醫生的判斷建構學習循環,且業界應共用評估基準線,而不是各自為政。”
完整解析
詳細Sondermind 是一家為全國超過百萬用戶媒合心理治療師和精神科醫生的心理健康護理公司。講者 Aka Breed 指出,儘管心理健康支持是當今 AI 最重要的應用領域之一,但通用語言模型本未為精神健康護理設計,導致社群媒體和新聞上頻頻出現不當案例。根據美國心理學會的最新調查,77% 的心理學家表示患者正在使用 AI 尋求某種心理健康支持,凸顯了這個市場缺口的實際規模。為此,Sondermind 開發了 Sonder——一款基於臨床經驗的 AI 教練,對話式介面搭配語音功能,能幫助用戶反思自身生活、追蹤目標、練習循證接地技法,並提供全天候支持。
系統架構採取輸入和輸出雙層護欄設計。輸入護欄在收到用戶訊息時進行檢查,判斷在 Sonder 核心回應前是否需干預;輸出護欄則檢視 AI 回應和整個對話進度,在偵測到臨床安全風險時進行干預。Sondermind 發現通用 LLM 的內建護欄過度校準,容易在用戶脆弱時刻進行不當限制,導致患者感受孤立而非支持,因此關閉了這些預設護欄並自建了更精準的系統。他們將護欄設計為獨立的語言模型組件,使其更難被規避或通過對話引導「越獄」,代價是增加了延遲和成本,但在這個使用場景中被認為值得。
第二講者 Dave Revier 深入討論了臨床細微差別的難題。他提出核心工程挑戰:「文字並不總是傳達訊息」。舉例來說,「我打包了一個箱子,只是想體驗離開的感覺」這句話可能看似無害,但臨床醫生根據真實患者經驗能認出其下隱含的自殺意圖。這種信號不在單一詞彙,而在言下之意和脈絡。簡單的詞彙黑名單、冗長提示說明或外部審核 API 都無法捕捉這層臨床細微差別。解決方案是臨床醫生對真實對話進行標註,形成「類型化評估」(conversation input、expected result、expected observation、metadata),每次系統或模型改變都必須根據這個評估集重新計分。
Sondermind 圍繞護欄校準做出三個設計選擇:首先,臨床主題擁有「好」的定義權,而非追求完美校準;其次,標註場景成為版本發布的評估基準,衡量假陽性(誤判危機)、假陰性(漏掉風險)、分類準確度和觸發時機;第三,追求基準線不為了完美,而是觀察真實數據中的實際故障模式。鑑於此類問題並非 Sondermind 獨有,他們決定開源數據集——200 個輸入護欄場景和 100 個輸出護欄場景,每個都經臨床審查,根據真實對話模式在心理健康各面向進行校準。這個共同基準線對整個業界至關重要,因為根據每家公司的校準選擇,真實傷害可能因此發生。最後,在現場問答中,講者確認 Sondermind 使用的 LLM 已關閉內建護欄(因為過度校準),並在假陽性與假陰性間傾向接受更多假陽性,以確保不漏掉真實風險。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


