KeyFrame內部研究專用

🔬Causal Models Need Causal Data - Xaira’s X-Cell model for Drug Discovery (Bo Wang & Ci Chu, Chief Discovery Officer & Chief AI Scientist)

Latent Space·7月21日週二·89 min英文

三句話摘要

Zera Therapeutics 發表虛擬細胞(Virtual Cell)AI 模型 Excel,首次在細胞擾動預測上超越線性基準並展示強大泛化能力。 虛擬細胞從觀察數據到因果數據、從自迴歸到擴散模型、從單一先驗到多源先驗的系統創新,首次讓 AI 在細胞擾動預測上打敗線性基準且具有強泛化能力,為藥物發現加速和個體化醫學奠定基礎。 虛擬細胞之所以可行,是因為換用了正確的數據策略。過去用靜態觀察數據(Cell×Gene 資料庫 33 百萬細胞)訓練的 foundation model 雖然擅長跨批次調和,卻在因果預測任務上敗給線性模型。根本原因是觀察數據中相關性結構太多,無法從中唯一推導因果網絡;Zera 改用因果數據——用高通量 Perturb-seq 系統地擾動每一個基因、測量全基因組反應,產生 25 百萬高質量細胞的 2D 張量。這樣的數據才能支撐真正的擾動預測模型。

重點整理

重點
  • 1

    虛擬細胞之所以可行,是因為換用了正確的數據策略。過去用靜態觀察數據(Cell×Gene 資料庫 33 百萬細胞)訓練的 foundation model 雖然擅長跨批次調和,卻在因果預測任務上敗給線性模型。根本原因是觀察數據中相關性結構太多,無法從中唯一推導因果網絡;Zera 改用因果數據——用高通量 Perturb-seq 系統地擾動每一個基因、測量全基因組反應,產生 25 百萬高質量細胞的 2D 張量。這樣的數據才能支撐真正的擾動預測模型。

  • 2

    模型架構上,Excel 用擴散語言模型而非自迴歸訓練:自迴歸要預設基因順序,但基因表達量本身無固有順序;擴散模型則迭代精化粗糙預測,更符合細胞生物學的動態特性。此外融合 5 種先驗(基因文本嵌入、PPI 網絡、差異基因表達、形態學、細胞類型表示),每種先驗在不同細胞類型的重要度不同,增強了可解釋性。

  • 3

    泛化能力驗證最令人矚目:模型用靜息 T 細胞訓練、沒見過活化 T 細胞,卻能準確預測活化狀態下的基因擾動效應,甚至發現新的生物學現象;用細胞系訓練能預測原代細胞,跨供體準確;用其他細胞類型訓練能預測完全未見的細胞類型。這打破了過去認為必須用該細胞類型本身數據才能預測的假設。

實用技巧與重點

乾貨
  • 模型與數據
  • 模型參數:4.9 billion
  • 訓練數據規模:25 百萬細胞(質控後)
  • 覆蓋範圍:7 次 genome-wide 擾動篩選、16 種生物背景、細胞系 + IPSC + 原代細胞 + 分化細胞
  • 關鍵技術
  • 擾動方法:高通量 CRISPR-Cas9(pooled pull 實驗,一次擾動 20,000 基因)+ single-cell RNA-seq
  • 單細胞測序平台:droplet-based single-cell RNA-seq(可同時測量單細胞中全部 20,000 基因)
  • 關鍵數據流程:CRISPR GuideRNA barcode 讀取 → 推導各細胞被擾動的基因 → 單細胞 RNA-seq 測量全基因組反應
  • 融入的 5 種先驗
  • Gene PT(文本嵌入):基因的文字描述
  • PPI 網絡(蛋白質相互作用網絡)
  • DEG(差異基因表達信息)
  • 形態學信息
  • SCGPT 細胞類型嵌入
  • 驗證案例
  • 靜息 T 細胞 → 活化 T 細胞擾動預測(模型未見活化狀態)
  • 多細胞類型 IPSC 分化實驗:保留 1 種細胞類型不參與訓練,預測準確度高
  • 細胞系(T cell line)→ 原代 T 細胞(多供體):準確預測已驗證
  • 基準與指標
  • 對標:線性基準(擾動 delta 線性疊加)、SCGPT、基因 Formers 等
  • 核心指標:Pearson Delta(預測基因表達變化 vs 真實變化的相似度)
  • 開源釋出
  • 模型、數據集、代碼均在 Bo Wang 實驗室 GitHub 公開
  • 承諾:持續開源 Zera 生成的更多數據與模型

結論

結論

虛擬細胞從觀察數據到因果數據、從自迴歸到擴散模型、從單一先驗到多源先驗的系統創新,首次讓 AI 在細胞擾動預測上打敗線性基準且具有強泛化能力,為藥物發現加速和個體化醫學奠定基礎。

完整解析

詳細

虛擬細胞的野心是用 AI 替代昂貴而耗時的生物實驗。藥物開發傳統上依賴試錯,每種新藥需 10-20 年、耗資數十億美元,第三期臨床試驗成功率只有 5-10%。根本瓶頸是無法預測人體細胞和患者對藥物的真實反應。生物學太複雜,無法用簡單的微分方程描述,這是過去虛擬細胞 1.0(數學模型)失敗的原因。當語言模型在文本領域成功後,研究者開始用 foundation model 的資料驅動思路去模擬細胞。但 2023 年 Bo Wang 等人發現了關鍵矛盾:用靜態基因表達數據(Cell×Gene 資料庫)訓練的 SCGPT 雖然能調和不同實驗室的數據,卻無法在擾動預測上超越線性模型。原因在於觀察數據中一個相關結構(比如基因 A、B、C 都上升)對應多種可能的因果機制(A 驅動 B、C;或 B 驅動 A、C;或都由第三者驅動),模型無法從中學到真正的因果關係。

Zera 的突破是投資建立高通量 Perturb-seq 實驗系統,系統地敲低每個基因、觀察全基因組反應。他們用 pooled CRISPR-Cas9 一次擾動 20,000 個基因(通過 GuideRNA barcode),再用單細胞 RNA-seq 同時讀出每個細胞全部 20,000 個基因的表達,產生一個龐大 2D 張量(基因 × 細胞 × 擾動 × 細胞類型)。光是品質控制就要篩選數億細胞,因為規模化過程中細胞會積累應激信號;他們採用化學固定、時間錯開操作等工程手段鎖定細胞狀態並消除批次效應。最終得到 25 百萬高品質細胞,跨越細胞系、IPSC 和原代細胞,涵蓋 16 種生物背景。

新模型 Excel 的架構也很關鍵。過去 SCGPT 用自迴歸方式訓練(模擬語言模型逐 token 預測),但基因表達本質上是無序的 matrix,強行預設順序很不自然。Excel 改用擴散模型:從噪聲開始,反覆迭代精化基因表達預測,最小化損失函數,就像編輯句子一樣。這符合細胞生物學的動態過程。此外,Excel 融合了 5 種先驗知識(基因的文字描述、蛋白質交互網絡、差異基因表達、形態學、細胞類型表示),讓模型在訓練時對生物背景有更好的認知。這些先驗不是必需的(是可學習參數),但在推理時提供可大幅改進預測準確度。

最令人興奮的是泛化驗證。用靜息 T 細胞訓練,模型完全沒見過活化 T 細胞的數據,卻能準確預測活化狀態下的擾動效應——不僅復現已知生物學(TCR 複合體失活時下調),還預測出新的生物學現象,後來被獨立實驗驗證。同樣用細胞系訓練、卻能預測原代 T 細胞(多個健康供體),以及跨細胞類型預測。這打破了以往認為必須用該特定背景的細胞訓練才能預測的限制。對照組是線性基準(把靜息狀態的擾動 delta 直接疊加到活化細胞),線性模型完全失敗,而 Excel 預測與真實數據的相似度遠超線性基準,視覺上一眼可見。

講者指出,這些成功的必要條件是數據質量和多樣性。Perturb-seq 產生的是自然無批次效應的因果數據,模型不需額外代價去消除批次干擾。此外跨越不同生物背景(從癌症細胞系、血液細胞系到 IPSC、分化細胞)的多樣化訓練數據,讓模型學到上下文通用和上下文特異的擾動規律:某些擾動在所有細胞類型一致(如管家基因),某些在特定背景才活躍(如 IPSC 中的分化相關基因)。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。