KeyFrame內部研究專用

Evals-Driven Development for a Mental Health AI Coach — Akele Reed & Dave Revere, SonderMind

AI Engineer·7月25日週六·21 min英文

三句話摘要

設計兼具倫理和安全的心理健康 AI 教練:從臨床細微差別到開源評估框架。 在 AI 心理健康應用中,安全不能只靠技術規則達成,必須透過臨床醫生的判斷建構學習循環,且業界應共用評估基準線,而不是各自為政。 通用 LLM 護欄過度校準的困境

重點整理

重點
  • 1

    通用 LLM 護欄過度校準的困境

  • 2

    一般大型語言模型的內建護欄往往過於保守,導致患者在脆弱時刻反而感到被拒絕和孤立。Sondermind 因此關閉了預設護欄,自建精準度更高的系統,目標是「精準觸發」而非「觸發越多越好」。

  • 3

    臨床細微差別無法被簡單規則捕捉

  • 4

    講者舉例「我打包了一個箱子,只是想體驗離開的感覺」——這句話可能表達隱含的自殺意圖,但純技術手段(詞彙黑名單、API 審核)無法偵測。必須由臨床醫生基於真實患者經驗來標註和教會系統。

  • 5

    學習循環的設計核心

  • 6

    臨床醫生對標註的對話進行「類型化評估」(輸入、預期輸出、觀察結果、後設資料),每次系統調整都必須根據這個評估集重新評分。勝利不在修復單一句子,而在於整個風險類別的正確處理。

  • 7

    假陽性 vs 假陰性的權衡選擇

  • 8

    Sondermind 接受更多假陽性(誤判危機)以避免假陰性(漏掉真實風險),同時透過臨床判斷定義「好」的標準,而非追求完美校準。

實用技巧與重點

乾貨
  • 公司背景
  • Sondermind:心理健康護理配對平台
  • 服務超過 100 萬人全國用戶
  • 合作夥伴:Headspace、Etna、Anthem
  • Sonder 功能
  • 對話式 AI 教練,支援語音輸入
  • 全天候 24/7 支持
  • 循證接地練習(grounding exercises)
  • 追蹤目標進度、準備治療課程、治療間隙支持
  • 護欄架構
  • 輸入護欄:檢查使用者訊息是否需干預
  • 輸出護欄:檢查 AI 回應和對話進度
  • 臨床統計
  • 美國心理學會調查:77% 心理學家患者正使用 AI 獲得心理健康支持
  • 開源資料集
  • 200 個輸入護欄場景(clinically reviewed)
  • 100 個輸出護欄場景
  • 涵蓋心理健康各面向、單回合與多回合對話
  • 標註方法
  • 對話輸入 → 預期結果 → 預期觀察值 → 後設資料
  • 回合索引:能重播對話至護欄應啟動時點
  • 註釋提取腳本:自動分類並產生報告

結論

結論

在 AI 心理健康應用中,安全不能只靠技術規則達成,必須透過臨床醫生的判斷建構學習循環,且業界應共用評估基準線,而不是各自為政。

完整解析

詳細

Sondermind 是一家為全國超過百萬用戶媒合心理治療師和精神科醫生的心理健康護理公司。講者 Aka Breed 指出,儘管心理健康支持是當今 AI 最重要的應用領域之一,但通用語言模型本未為精神健康護理設計,導致社群媒體和新聞上頻頻出現不當案例。根據美國心理學會的最新調查,77% 的心理學家表示患者正在使用 AI 尋求某種心理健康支持,凸顯了這個市場缺口的實際規模。為此,Sondermind 開發了 Sonder——一款基於臨床經驗的 AI 教練,對話式介面搭配語音功能,能幫助用戶反思自身生活、追蹤目標、練習循證接地技法,並提供全天候支持。

系統架構採取輸入和輸出雙層護欄設計。輸入護欄在收到用戶訊息時進行檢查,判斷在 Sonder 核心回應前是否需干預;輸出護欄則檢視 AI 回應和整個對話進度,在偵測到臨床安全風險時進行干預。Sondermind 發現通用 LLM 的內建護欄過度校準,容易在用戶脆弱時刻進行不當限制,導致患者感受孤立而非支持,因此關閉了這些預設護欄並自建了更精準的系統。他們將護欄設計為獨立的語言模型組件,使其更難被規避或通過對話引導「越獄」,代價是增加了延遲和成本,但在這個使用場景中被認為值得。

第二講者 Dave Revier 深入討論了臨床細微差別的難題。他提出核心工程挑戰:「文字並不總是傳達訊息」。舉例來說,「我打包了一個箱子,只是想體驗離開的感覺」這句話可能看似無害,但臨床醫生根據真實患者經驗能認出其下隱含的自殺意圖。這種信號不在單一詞彙,而在言下之意和脈絡。簡單的詞彙黑名單、冗長提示說明或外部審核 API 都無法捕捉這層臨床細微差別。解決方案是臨床醫生對真實對話進行標註,形成「類型化評估」(conversation input、expected result、expected observation、metadata),每次系統或模型改變都必須根據這個評估集重新計分。

Sondermind 圍繞護欄校準做出三個設計選擇:首先,臨床主題擁有「好」的定義權,而非追求完美校準;其次,標註場景成為版本發布的評估基準,衡量假陽性(誤判危機)、假陰性(漏掉風險)、分類準確度和觸發時機;第三,追求基準線不為了完美,而是觀察真實數據中的實際故障模式。鑑於此類問題並非 Sondermind 獨有,他們決定開源數據集——200 個輸入護欄場景和 100 個輸出護欄場景,每個都經臨床審查,根據真實對話模式在心理健康各面向進行校準。這個共同基準線對整個業界至關重要,因為根據每家公司的校準選擇,真實傷害可能因此發生。最後,在現場問答中,講者確認 Sondermind 使用的 LLM 已關閉內建護欄(因為過度校準),並在假陽性與假陰性間傾向接受更多假陽性,以確保不漏掉真實風險。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。