KeyFrame內部研究專用

How AI Learns to Smell with Alex Wiltschko - #771

TWIML AI·7月8日週三·59 min英文

三句話摘要

給計算機賦予嗅覺能力,建立olfactory intelligence系統來理解、預測和設計香氛分子。 嗅覺智能展示了AI如何透過學習非人類物種的「語言」(化學分子)來超越文本和圖像侷限,以及如何用合理的商業應用反哺基礎科學發展。 嗅覺系統的複雜度被低估。人類擁有300多種嗅覺感受體,比視覺的RGB三通道高維得多。嗅覺神經元是少數幾個直接接觸外界的腦神經,人類對某些分子的敏感度達到奧運游泳池中一滴眼淚的濃度,但這種能力長期被忽視。

重點整理

重點
  • 1

    嗅覺系統的複雜度被低估。人類擁有300多種嗅覺感受體,比視覺的RGB三通道高維得多。嗅覺神經元是少數幾個直接接觸外界的腦神經,人類對某些分子的敏感度達到奧運游泳池中一滴眼淚的濃度,但這種能力長期被忽視。

  • 2

    圖神經網絡解決了結構-氣味映射難題。以分子的原子為節點、化學鍵為邊,訓練神經網絡預測分子氣味。Odor-Turing Test驗證了模型預測精度超過人類平均水準,打破了科學界認為此問題無法解決的認知。

  • 3

    Principal Odor Map揭示了自然的設計邏輯。約300維的嗅覺embedding空間中,相同氣味的分子自然聚集,且子類型形成嵌套結構。這個結構無人為設計,卻對應生物生成氣味的方式——花香、發酵、草本各占據由演化決定的空間。

  • 4

    商業化反哺科學發展。香氛設計平台將文本/圖像請求編碼到嗅覺空間,再解碼為分子配方。每筆商業訂單都產生新的嗅覺數據和化學傳感器讀數,形成自我強化的數據迴圈,同時為foundation model的構建積累資料。

實用技巧與重點

乾貨
  • 生物學基礎
  • 人鼻嗅覺感受體:300+種
  • 人眼光感受體:3種(RGB)
  • 嗅覺神經元特性:唯一穿出顱骨直接接觸世界的腦神經
  • 人類嗅覺靈敏度:部分分子檢測範圍達ppb/ppt(十億/兆分位)
  • 數據規模
  • 初始數據集:5,000個分子
  • 嗅覺標註數據集(SNFs):543萬筆
  • 分子枚舉總數:60億個可能的有氣味分子
  • 國際品嗅人員:分散全球的訓練嗅覺評估團隊
  • 技術棧
  • 核心架構:圖神經網絡(Graph Neural Network)、Transformer
  • Principal Odor Map維度:約300維
  • 降維方法:主成分分析(PCA)
  • 多模態輸入:文本、圖像、化學傳感器數據
  • 商業應用
  • 香氛生產速率:100秒/件
  • 機器人工廠規模:校車大小
  • 調香方式:自動混合現有成分或設計新分子
  • 品質測試:皮膚安全性、呼吸道安全性、眼睛刺激性、水生生物毒性
  • 設備進展
  • 當前可部署傳感裝置:兩個鞋盒大小,達人鼻靈敏度
  • 短期目標:嬰兒鞋盒大小
  • 長期願景:手機內芯片集成
  • 關鍵概念
  • Odor-Turing Test:預測未聞分子氣味並驗證
  • Retronasal Olfaction:逆向嗅覺(咀嚼時分子反向進入鼻腔)
  • 風味構成:90%嗅覺 + 10%味覺
  • 機構與人物
  • Osmo:Alex Wilczko創辦
  • 合作者:Joel Mainland(Monell Chemical Senses Center)
  • 前Google Brain研究小組

結論

結論

嗅覺智能展示了AI如何透過學習非人類物種的「語言」(化學分子)來超越文本和圖像侷限,以及如何用合理的商業應用反哺基礎科學發展。

完整解析

詳細

嗅覺對地球99%的物種而言是唯一的交流語言。細菌、真菌、植物和昆蟲只能透過分子傳遞訊息,但與文本、影像不同,香氣從未被妥善數位化。Osmo創始人兼前Google DeepMind研究員Alex Wilczko正在改變這一現狀,建立olfactory intelligence——能夠建模、預測和設計香氛的AI系統。

理解嗅覺AI的第一道難關是建立表示法。視覺有RGB三個通道,聽覺有頻率一個維度,但人類嗅覺擁有300多種嗅覺感受體。這些感受體是嗅覺神經元,它們是穿出顱骨直接接觸世界的少數腦神經之一。當你聞到什麼時,你的大腦正在物理接觸另一生命體。人類的嗅覺驚人敏銳——對某些分子的檢測精度相當於在奧運游泳池中偵測一滴淚水,但這種超常能力長期被科學界忽視。

Google Brain的突破來自一個困擾科學界100年的基礎問題:給定分子的化學結構(原子和化學鍵),能否預測它聞起來是什麼?許多人認為此問題無法解決。Wilczko團隊採用圖神經網絡——一種擅長處理圖結構的架構,其中分子的原子是節點,化學鍵是邊。他們收集數千對分子-氣味描述符組合,成功訓練出預測模型。驗證方式是Odor-Turing Test:預測從未有人聞過的全新分子的氣味特徵,物理製造這些分子,讓經過八小時訓練的人類評估人員進行雙盲評估,比較人類小組平均水準與AI預測。結果令人驚訝:模型預測精度超越了任何單一人類評估者。

更深層發現在於神經網絡的embedding層——一個約300維的向量空間,高度可疑地與嗅覺感受體數量相符。當用主成分分析投影到二維可視化時,相同氣味的分子自然聚集成區域。花香、發酵、草本等氣味各占據一個空間區塊,且更驚人的是,子類型(如茉莉、玫瑰、紫羅蘭)自然形成花香區域內的子集——團隊從未告訴演算法這種嵌套關係存在。發酵香氛區域甚至在首次模型訓練時意外呈現瓶子形狀。這個Principal Odor Map似乎講述了自然製造氣味的故事:發酵香氛由酵母菌產生的生物過程創造,花香來自遺傳相關的植物物種。

從分子結構映射到商業應用需要數據規模。團隊初期透過創意資料授權、網際網路搜尋和Wilczko 15年的業界經驗積累了5000個分子的初始資料集。現已擴展到枚舉所有可能的有香氛分子(60億個),並收集543萬筆人類嗅覺標註數據——迄今最大的olfactory訓練集。數據類型多樣:分子結構配合人類描述符(甜、草本、香草)、真實產品(超市黃瓜)、化學感測器讀數。商業模式利用此基礎:客戶述說「我想要清新感受、吸引Gen Z男性」,系統將需求編碼到嗅覺感知空間,解碼回具體分子配方,交由校車大小的機器人工廠執行,每100秒生產一種新香氛。關鍵是每次商業應用都回饋數據:製造的香氛被人類評估、化學感測器掃描,結果重新訓練模型。

團隊最終願景是building an olfactory foundation model,類似大型語言模型但理解化學感知世界。這需要突破性的大規模數據收集——如癌症檢測、疟疾診斷。雖然犬隻能做到這些,計算機需要統計量級的數據和明確基準。目前可部署的傳感裝置已達人鼻水準(兩個鞋盒大小),長期目標是手機內芯片集成。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。