🔬 The Lab of the Future Should Feel Like a Data Center — Andy Beam & Rafa Gómez-Bombarelli, Lila Sciences
三句話摘要
Lila Science 建立 AI 科學工廠,用自動化實驗室和大規模資料生成來訓練推理模型解決科學難題。 Lila Science 相信透過讓 AI 模型持續設計和驗證科學實驗,可以構建新型科學推理模型,最終創造解決複雜科學問題的超級智能系統。 苦澀教訓與規模化之必然性:相信規模化和通用方法勝過特定領域優化。互聯網資料已用盡,科學實驗是新的大規模資料來源。Lila 認為,未來突破 AI 的限制,就要找到能像互聯網一樣源源不絕的資料——而科學實驗恰好滿足這一需求。
重點整理
重點- 1
苦澀教訓與規模化之必然性:相信規模化和通用方法勝過特定領域優化。互聯網資料已用盡,科學實驗是新的大規模資料來源。Lila 認為,未來突破 AI 的限制,就要找到能像互聯網一樣源源不絕的資料——而科學實驗恰好滿足這一需求。
- 2
實驗室即資料中心的架構:建立高度自動化、密集化的實驗室,用「PCI 總線」概念將所有儀器互聯,模型通過 API 同時調用機器人和人類完成實驗。這種設計使實驗室既能執行預設工作流,又能應對模型設計的全新實驗協議。
- 3
非生物技術公司的戰略定位:Lila 的核心產品是推理模型本身,實驗室只是 token 生成機制。商業模式是讓合作夥伴以虛擬新創形式使用平台,成本和時間相比傳統生技公司省 90%,這使大量科學假說得以快速驗證。
- 4
科學嚴謹性與 AI 安全的雙重把關:堅持傳統科學標準,防止 AI 幻覺和不切實際建議。用多維環境資料和可重複驗證來信任 AI 的建議,設有 EHS 防護層,把人類判斷力嵌入 API 呼叫流程。
實用技巧與重點
乾貨- 核心人物
- Andy Beam(CTO):AI 研究 20 年,前哈佛醫學院
- Rafa Gomez-Bombrelli(物理科學首席科學官兼共同創始人):計算化學家,MIT 材料科學工程小組主持人
- Ken Stanley(開放性探索團隊負責人):AI 創造力研究先驅
- 實驗室基礎設施
- 96 孔板(實驗原子單位)
- 磁浮傳輸層(平面馬達系統),毫米級精度控制
- PCI 總線概念:所有儀器圖形互聯
- 液體處理器、自旋塗佈機、磁控濺射機等數十種儀器
- 自訂固件驅動,甚至用 Vision Language Model 控制 Windows 95 舊機器
- 訓練資料:10 萬億科學 token,涵蓋生命科學、化學、材料科學
- 應用成果
- 量子點:訪客指定波長,模型在 1-1.5 小時完成實驗迭代
- mRNA 設計:相比 Moderna/Pfizer 參考數據提升 10 倍表達
- CAR-T 治療:6 個月完成,非人類靈長類動物數據超越 Capstan(被 ABV 以 21 億美元收購)
- 電催化劑(無鉑族):發現性能超越人類專家期望的設計
- MOF 材料:跨域遷移成功
- 磁性吸附測試:速度提升 2,500 倍(從每樣本數天到 1 小時)
- 商業模式
- 虛擬新創模式:合作夥伴提供想法,Lila 提供平台
- 合同結構:平台使用費 + 試劑成本 + 上游分成
- 可擴展至數百數千個並行專案
- CAR-T 案例:6 個月、2-3 人、投資 10%
- 安全措施
- AI 安全團隊從初期就參與
- 約束實驗能力暴露範圍
- 化學 EHS 防護層
- 可重複驗證機制
- 嚴格遵循傳統科學標準
- 關鍵資料點
- 互聯網資料完全用盡
- 96 孔板格式覆蓋 80-20 應用
- 臨床試驗成功率 5-8%
結論
結論“Lila Science 相信透過讓 AI 模型持續設計和驗證科學實驗,可以構建新型科學推理模型,最終創造解決複雜科學問題的超級智能系統。”
完整解析
詳細AI 大模型的成功源於大規模計算和互聯網資料的組合,但互聯網資料已經完全耗盡。這是 Lila Science 團隊面臨的核心問題:下一個網路級規模的資料集從哪裡來?由前哈佛醫學院研究者 Andy Beam 和 MIT 材料科學教授 Rafa Gomez-Bombrelli 等人創辦的 Lila,提出了激進的答案——科學實驗本身可以成為「無限 token 生成器」。
與其他生物技術公司不同,Lila 的核心產品不是藥物或材料,而是能夠自主設計和執行科學實驗的推理模型。為實現這一目標,他們建立了規模龐大的自動化實驗室系統。該系統採用「PCI 總線」概念,將所有儀器通過磁浮傳輸層互聯成圖形網路。96 孔板通過磁力懸浮在軌道上、毫米級精度移動,連接液體處理器、離心機、分光光度計、磁控濺射機等數十種儀器。所有操作都通過 API 呼叫實現——有時調用機器人,有時調用人類。模型給出實驗指令,系統自動分配給最高效的執行者,使人類和機器人都成為 API 層下的執行單位。
Lila 系統的獨特優勢在於跨域能力。訓練資料涵蓋生命科學、化學和材料科學,共 10 萬億科學 token。這種廣泛的跨域訓練使模型能在看似無關的領域間遷移。針對小分子藥物發現訓練的化學知識,竟能應用於金屬有機框架(MOF)材料設計,用於 CO2 捕獲。模型一般性的科學推理能力在樣本對樣本的比較中,經常超越領域特定的專用模型。
在驗證和安全方面,Lila 採取謹慎態度。AI 建議不是盲目執行,而要經過嚴格科學標準檢驗。團隊強調不能因為是 AI 就降低科學嚴謹性。為防止浪費,系統在多維度收集資料——除主要結果外,還記錄濕度、溫度等環境變數,即使失敗也能解釋原因。化學和 EHS 防護層會篩選不切實際建議。經過早期 RL 訓練中的「詛咒」和「重複」等病理問題後,他們學會了區分計算推理和實驗驗證,信任實驗結果而非推理過程。
商業模式上,Lila 開創了「虛擬新創公司」模式。合作夥伴無需建立實驗室或組建團隊,只需提出明確問題,Lila 就能在數月內完成通常需數年和數百萬美元的研發。一個成功案例是 CAR-T mRNA 設計:僅用 6 個月和 2-3 名研究人員,Lila 完成了相當於 5 年生技工作量的研究,其非人類靈長類動物數據甚至超越被 ABV 以 21 億美元收購的 Capstan 臨床前數據。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


