AI科研圈的精神狂热 | Transformer作者Lukasz Kaiser | 底层设计短板 | 模型的学习效率 | 完全抛弃IDE | 思考逻辑像外星人 | 长上下文难题 | 模型能力跃迁
三句話摘要
Transformer論文作者Lukasz Kaiser深度剖析AI架構、模型能力與產業未來的第一手觀察。 Transformer架構雖未達理論極限但足以支撐當下產業,AI的真正進化將來自後Transformer新架構的突破與AI Agent對科研方式的深度賦能,但核心瓶頸歸根結底還是大模型採用的「外星人邏輯」與人類認知的永恆鴻溝。 Transformer架構的結構性缺陷與多模態困境
重點整理
重點- 1
Transformer架構的結構性缺陷與多模態困境
- 2
Transformer撐起行業基本盤,但遠未達理論極限。多模態產品本質只是框架拼接,無革命性優化。人類視覺毫秒級同步捕捉全局信息,但Transformer處理高清圖像必須逐Token分解計算,全程高度線性化,導致模型無法毫秒級完整吸收高分辨率圖像,這是多模態產品在實景理解和物理感知層面頻繁失效的根本原因。
- 3
「外星人邏輯」的非人類泛化能力
- 4
大模型不是泛化能力缺失,而是採用人類完全無法理解的邏輯完成泛化。同一模型在代數與幾何題上能力天差地別,不是因為缺乏空間感知,而是在特徵表徵空間裡兩類內容完全割裂。海量幾何文本數據能突然改善幾何性能,證明模型無法自然遷移解題思路,只能靠大量同域數據重新學習,導致能力邊界充滿不可預知的隱性盲區。
- 5
AI Agent的雙重影響:效率與責任
- 6
AI Agent將論文復現周期從三週壓縮至兩天,還讓研究員可同時並行多個項目。但AI會自作主張新增損失函數導致實驗失真,要求研究員時刻保持對底層邏輯的清醒認識。這種持續管控AI潛在失誤的工作模式,反而倒逼研究員的宏觀思維精進,形成正向迴圈。
- 7
工程落地的真理:效果優先於優雅度
- 8
長上下文最優解是檔案存儲+grep檢索+AI索引的樸素組合,五年前會被業界視為治標不治本的創可貼方案,卻成為商用場景中遠超花哨算法改造的最佳實踐。這體現了產業界的核心原則:永遠以落地效果評判方案優劣。
實用技巧與重點
乾貨- 硬件性能對比
- 2017年Transformer團隊:八卡GPU集群,70~80 TFLOPS
- 2026年RTX5090:FP32峰值400T FLOPS;BF16實際有效算力200T FLOPS(超當年2.5倍+)
- 大模型學習成本
- 掌握基礎概念需消耗:萬億級Token數據
- 人類對比:小孩見3~4種貓就能識別,大模型需海量樣本
- 自動駕駛案例
- Waymo模擬路況:數百萬英里虛擬里程
- Waymo現實里程:海量級別
- 失效場景:高速公路臨時施工路段
- 科研效率數據
- 論文復現耗時:3週(傳統) → 2天(Codex輔助)
- 並行項目數:1個(傳統) → 3個(AI Agent)
- 長上下文方案組成
- 檔案存儲 + grep文本檢索 + AI生成索引 + 強化學習壓縮
- 廠商戰略差異
- OpenAI:全面押注推理模型(o1、o3),但因用戶體量和合規風險逐步收斂激進文化
- Anthropic:放棄通用聊天正面競爭,差異化聚焦代碼模型Claude Code
- Google:全賽道廣撒網,短板是難以單點突破,優勢是技術儲備充足
結論
結論“Transformer架構雖未達理論極限但足以支撐當下產業,AI的真正進化將來自後Transformer新架構的突破與AI Agent對科研方式的深度賦能,但核心瓶頸歸根結底還是大模型採用的「外星人邏輯」與人類認知的永恆鴻溝。”
完整解析
詳細Lukasz Kaiser身為Transformer論文八人組的核心作者,在這次訪談中系統性地分析了AI產業面臨的架構困局、模型能力的反直覺特性,以及科研工作方式的深度變革。
從架構層面切入,Kaiser明確指出Transformer雖然撐起了全行業的大模型和多模態產品基本盤,但遠未達到理論上本該達到的性能上限。特別是多模態領域,現有方案本質上只是在Transformer框架上做拼接改造,無任何底層架構層面的革命性優化。人類視覺能在毫秒級時間內同步捕捉整個畫面的全局信息,但Transformer處理高清圖像時必須將整張圖片切割成無數小塊Token,逐個依序計算,整個流程高度線性化。這種拆分邏輯直接導致模型無法在毫秒尺度完整吸收高分辨率圖像,這正是現有多模態產品在實景理解和物理世界感知層面頻繁翻車的根本原因。也正因為這些客觀短板,全球各大實驗室才掀起了後Transformer新架構的研發浪潮,但截至目前還沒有任何備選架構跑出決定性優勢。
在模型能力的本質問題上,Kaiser提出了全訪談中最出圈的核心觀點:大模型不是不具備跨域泛化能力,而是在以人類完全無法理解的「外星人邏輯」來完成泛化。他用幾何與代數題型作為具體案例。同一個模型能輕鬆攻克高等代數和數理邏輯這類超高難度的數學題,卻在歐式幾何上反覆失手,業內一度判定模型缺乏空間感知的底層能力。但後續僅通過補充海量幾何題目的文本數據——注意這裡沒有任何新增實景和空間圖像訓練素材——模型突然就能批量破解幾何難題。站在人類視角,代數和幾何同屬數學大類,邏輯具備高度的關聯性,人類學會代數能自然遷移部分解題思路到幾何。但在模型的特徵表徵空間裡,兩類內容處於完全割裂的位置,跨域遷移無法自然發生,只能靠海量同領域數據重新學習。這種鋸齒狀的怪異泛化直接導致大模型的能力邊界充滿了不可預知的隱性盲區,你永遠不知道模型在哪個看似相近的細分領域突然失效。
在AI Agent對科研工作的賦能層面,Kaiser展示了最具說服力的實踐數據。他親身經歷了從手工編寫代碼逐行調試的年代,到如今借助AI Agent全流程加速的完整變遷。復現一篇經典論文,傳統方式需要三週時間從零梳理代碼、調試環境、修復Bug才能跑通全量實驗,現在借助Codex只需兩天就能全部落地完成。但效率提升還只是表層變化,更深層的改變在於工作並行度的革命。過去做科研只能同一時段聚焦單個課題,大量精力被語法拼寫、函數命名、基礎代碼Bug占用,現在他可同時並行啟動三項不同方向的科研任務,基礎代碼實現全交由AI完成,自身只需把控整體實驗邏輯、損失函數設計、指標管控這些頂層內容。但這也帶來了新的挑戰和責任:AI在調試模型時會自作主張新增額外的輔助損失函數,AI本身認為這個優化方向合理,但實際落地後會導致實驗數據全面失真、模型訓練徹底跑偏。要規避這類隱性錯誤,研究員必須時刻保持對底層算法和訓練邏輯的高度清醒。也正是這種需要時刻管控AI潛在失誤的工作模式,倒逼研究員的宏觀思維持續精進。
在長上下文問題的解決上,Kaiser揭露了一個出人意料的真相:目前落地效果最好的長上下文解決方案,在五年前會被所有研究員視作粗劣的臨時補救方案。這套方案的邏輯其實非常樸素:核心就是把海量文本拆分存入本地檔案,借助文本檢索工具grep來做關鍵字檢索,再讓AI自主生成文檔索引,靠檔案存儲加本地檢索的方式繞開原生注意力機制在超長上下文下算力爆炸的缺陷。早年行業研究長上下文時,所有人都在優化注意力算法、改造位置編碼、設計稀疏注意力架構,沒人能想到最後落地的最優解竟然是靠傳統的文本檢索工具。進一步可搭配強化學習驅動的上下文壓縮技術提升效果。這個案例完美詮釋了工程落地領域的核心原則:從來不以方案設計的優雅度評判優劣,最終落地效果才是唯一的標準。
在硬件進化對AI科研的顛覆性影響上,Kaiser提供的數據格外震撼。2017年他和Transformer團隊研發初代Transformer時,實驗室的頂配是八卡GPU集群,整套設備總算力僅70~80 TFLOPS。而2026年消費級旗艦RTX5090的FP32官方峰值算力標稱約400T FLOPS,BF16精度下的實際有效算力約200T FLOPS,單張顯卡算力就達到了當年整套八卡集群的2.5倍以上。這意味著任何人只需在桌面配置一張RTX5090,就能在家完整復現2017年Transformer誕生以來所有經典科研實驗。硬件成本的持續下行直接拉低了AI前沿研究的入場門檻,高校課題組和獨立個人開發者不再需要依附頭部AI大厂的海量算力資源,就能開展後Transformer新架構的小規模探索。
在大小模型之爭上,Kaiser堅持自己的判斷:小模型永遠無法完全替代巨型參數的旗艦大模型。蒸餾而來的輕量化模型可以承接日常的標準化需求,性價比優異,但一旦面對複雜產業定製、前沿科研攻堅等重大問題,巨型原生大模型的綜合能力下限和隱性泛化能力是蒸餾小模型無法追趕的。他分享了自己的日常使用經歷:平時測試任務會優先選用輕量化的小模型,大部分常規任務可運轉正常,但總會在某個細分難點突然崩盤,最終只能換回原生大模型推進工作。閉源與開源模型的格局則會長期並行共存:閉源大厂手握頂尖的原生大模型,靠持續技術迭代守住商業化領先優勢;而各國政企出於數據主權和信息安全需求會持續投入開源模型研發,即便性能弱於同期閉源產品,本土化部署刚需也會持續驅動開源生態迭代。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


