🔬Causal Models Need Causal Data - Xaira’s X-Cell model for Drug Discovery (Bo Wang & Ci Chu, Chief Discovery Officer & Chief AI Scientist)
三句話摘要
Zera Therapeutics 發表虛擬細胞(Virtual Cell)AI 模型 Excel,首次在細胞擾動預測上超越線性基準並展示強大泛化能力。 虛擬細胞從觀察數據到因果數據、從自迴歸到擴散模型、從單一先驗到多源先驗的系統創新,首次讓 AI 在細胞擾動預測上打敗線性基準且具有強泛化能力,為藥物發現加速和個體化醫學奠定基礎。 虛擬細胞之所以可行,是因為換用了正確的數據策略。過去用靜態觀察數據(Cell×Gene 資料庫 33 百萬細胞)訓練的 foundation model 雖然擅長跨批次調和,卻在因果預測任務上敗給線性模型。根本原因是觀察數據中相關性結構太多,無法從中唯一推導因果網絡;Zera 改用因果數據——用高通量 Perturb-seq 系統地擾動每一個基因、測量全基因組反應,產生 25 百萬高質量細胞的 2D 張量。這樣的數據才能支撐真正的擾動預測模型。
重點整理
重點- 1
虛擬細胞之所以可行,是因為換用了正確的數據策略。過去用靜態觀察數據(Cell×Gene 資料庫 33 百萬細胞)訓練的 foundation model 雖然擅長跨批次調和,卻在因果預測任務上敗給線性模型。根本原因是觀察數據中相關性結構太多,無法從中唯一推導因果網絡;Zera 改用因果數據——用高通量 Perturb-seq 系統地擾動每一個基因、測量全基因組反應,產生 25 百萬高質量細胞的 2D 張量。這樣的數據才能支撐真正的擾動預測模型。
- 2
模型架構上,Excel 用擴散語言模型而非自迴歸訓練:自迴歸要預設基因順序,但基因表達量本身無固有順序;擴散模型則迭代精化粗糙預測,更符合細胞生物學的動態特性。此外融合 5 種先驗(基因文本嵌入、PPI 網絡、差異基因表達、形態學、細胞類型表示),每種先驗在不同細胞類型的重要度不同,增強了可解釋性。
- 3
泛化能力驗證最令人矚目:模型用靜息 T 細胞訓練、沒見過活化 T 細胞,卻能準確預測活化狀態下的基因擾動效應,甚至發現新的生物學現象;用細胞系訓練能預測原代細胞,跨供體準確;用其他細胞類型訓練能預測完全未見的細胞類型。這打破了過去認為必須用該細胞類型本身數據才能預測的假設。
實用技巧與重點
乾貨- 模型與數據
- 模型參數:4.9 billion
- 訓練數據規模:25 百萬細胞(質控後)
- 覆蓋範圍:7 次 genome-wide 擾動篩選、16 種生物背景、細胞系 + IPSC + 原代細胞 + 分化細胞
- 關鍵技術
- 擾動方法:高通量 CRISPR-Cas9(pooled pull 實驗,一次擾動 20,000 基因)+ single-cell RNA-seq
- 單細胞測序平台:droplet-based single-cell RNA-seq(可同時測量單細胞中全部 20,000 基因)
- 關鍵數據流程:CRISPR GuideRNA barcode 讀取 → 推導各細胞被擾動的基因 → 單細胞 RNA-seq 測量全基因組反應
- 融入的 5 種先驗
- Gene PT(文本嵌入):基因的文字描述
- PPI 網絡(蛋白質相互作用網絡)
- DEG(差異基因表達信息)
- 形態學信息
- SCGPT 細胞類型嵌入
- 驗證案例
- 靜息 T 細胞 → 活化 T 細胞擾動預測(模型未見活化狀態)
- 多細胞類型 IPSC 分化實驗:保留 1 種細胞類型不參與訓練,預測準確度高
- 細胞系(T cell line)→ 原代 T 細胞(多供體):準確預測已驗證
- 基準與指標
- 對標:線性基準(擾動 delta 線性疊加)、SCGPT、基因 Formers 等
- 核心指標:Pearson Delta(預測基因表達變化 vs 真實變化的相似度)
- 開源釋出
- 模型、數據集、代碼均在 Bo Wang 實驗室 GitHub 公開
- 承諾:持續開源 Zera 生成的更多數據與模型
結論
結論“虛擬細胞從觀察數據到因果數據、從自迴歸到擴散模型、從單一先驗到多源先驗的系統創新,首次讓 AI 在細胞擾動預測上打敗線性基準且具有強泛化能力,為藥物發現加速和個體化醫學奠定基礎。”
完整解析
詳細虛擬細胞的野心是用 AI 替代昂貴而耗時的生物實驗。藥物開發傳統上依賴試錯,每種新藥需 10-20 年、耗資數十億美元,第三期臨床試驗成功率只有 5-10%。根本瓶頸是無法預測人體細胞和患者對藥物的真實反應。生物學太複雜,無法用簡單的微分方程描述,這是過去虛擬細胞 1.0(數學模型)失敗的原因。當語言模型在文本領域成功後,研究者開始用 foundation model 的資料驅動思路去模擬細胞。但 2023 年 Bo Wang 等人發現了關鍵矛盾:用靜態基因表達數據(Cell×Gene 資料庫)訓練的 SCGPT 雖然能調和不同實驗室的數據,卻無法在擾動預測上超越線性模型。原因在於觀察數據中一個相關結構(比如基因 A、B、C 都上升)對應多種可能的因果機制(A 驅動 B、C;或 B 驅動 A、C;或都由第三者驅動),模型無法從中學到真正的因果關係。
Zera 的突破是投資建立高通量 Perturb-seq 實驗系統,系統地敲低每個基因、觀察全基因組反應。他們用 pooled CRISPR-Cas9 一次擾動 20,000 個基因(通過 GuideRNA barcode),再用單細胞 RNA-seq 同時讀出每個細胞全部 20,000 個基因的表達,產生一個龐大 2D 張量(基因 × 細胞 × 擾動 × 細胞類型)。光是品質控制就要篩選數億細胞,因為規模化過程中細胞會積累應激信號;他們採用化學固定、時間錯開操作等工程手段鎖定細胞狀態並消除批次效應。最終得到 25 百萬高品質細胞,跨越細胞系、IPSC 和原代細胞,涵蓋 16 種生物背景。
新模型 Excel 的架構也很關鍵。過去 SCGPT 用自迴歸方式訓練(模擬語言模型逐 token 預測),但基因表達本質上是無序的 matrix,強行預設順序很不自然。Excel 改用擴散模型:從噪聲開始,反覆迭代精化基因表達預測,最小化損失函數,就像編輯句子一樣。這符合細胞生物學的動態過程。此外,Excel 融合了 5 種先驗知識(基因的文字描述、蛋白質交互網絡、差異基因表達、形態學、細胞類型表示),讓模型在訓練時對生物背景有更好的認知。這些先驗不是必需的(是可學習參數),但在推理時提供可大幅改進預測準確度。
最令人興奮的是泛化驗證。用靜息 T 細胞訓練,模型完全沒見過活化 T 細胞的數據,卻能準確預測活化狀態下的擾動效應——不僅復現已知生物學(TCR 複合體失活時下調),還預測出新的生物學現象,後來被獨立實驗驗證。同樣用細胞系訓練、卻能預測原代 T 細胞(多個健康供體),以及跨細胞類型預測。這打破了以往認為必須用該特定背景的細胞訓練才能預測的限制。對照組是線性基準(把靜息狀態的擾動 delta 直接疊加到活化細胞),線性模型完全失敗,而 Excel 預測與真實數據的相似度遠超線性基準,視覺上一眼可見。
講者指出,這些成功的必要條件是數據質量和多樣性。Perturb-seq 產生的是自然無批次效應的因果數據,模型不需額外代價去消除批次干擾。此外跨越不同生物背景(從癌症細胞系、血液細胞系到 IPSC、分化細胞)的多樣化訓練數據,讓模型學到上下文通用和上下文特異的擾動規律:某些擾動在所有細胞類型一致(如管家基因),某些在特定背景才活躍(如 IPSC 中的分化相關基因)。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


