KeyFrame內部研究專用

AI 時代工程師怎麼重新定位自己:Andrej Karpathy 訪談解析

Gary Chen·5月17日週日·15 min中文

三句話摘要

AI時代程序員該如何重新定位自己——從Software 3.0、Jagged Intelligence到Agentic Engineering的三層框架。 AI不是讓你少想的工具,而是放大你深度思考ROI的槓桿——願不願意理解底層概念,決定了你在AI時代的天花板。 Software 3.0的典範轉移

重點整理

重點
  • 1

    Software 3.0的典範轉移

  • 2

    傳統軟體(Software 1.0)是人寫規則讓電腦執行;神經網路時代(Software 2.0)是訓練模型自動習得規則;現在(Software 3.0)是寫提示詞和管理上下文來指揮AI助理。Karpathy用自己的菜單App為例,發現用戶只需直接把照片丟給Gemini就能解決問題,整個App其實不需要存在——Software 3.0不是把舊東西做快,而是讓以前不可能的事現在能做到。

  • 3

    Jagged Intelligence的認知邊界

  • 4

    AI的能力分布像鋸齒狀而非平滑曲線。數學和代碼能力強因為答案可驗證且實驗室投入訓練;常識題較弱因為難以驗證且訓練資料投入少。這不是AI本身的限制,而是實驗室的產品決策——能驗證的領域可用強化學習讓AI跑百次實驗挑最好的,不能驗證就只能祈禱運氣。

  • 5

    Agentic Engineering vs Vibe Coding

  • 6

    Vibe Coding拉高所有人的下限(不會寫代碼也能做出工具),但Agentic Engineering決定你的上限(設計驗證機制、邊界約束、回滾策略,讓AI安全系統地試錯)。Karpathy的Auto Research範例:設置三個約束(只改一個文件、一個評分指標、時間預算),讓AI自動跑700個實驗、找到20個有用改動、縮短11%訓練時間。這不是十倍效率,而是指數級的放大。

  • 7

    理解不能外包,細節可以

  • 8

    API細節、Boilerplate、支付邏輯交給AI記,但Tensor的本質、用戶身份設計、資金歸屬邏輯必須自己理解。Karpathy舉例菜單App的身份驗證漏洞——AI的代碼能跑能測試通過,但系統設計在生產環境才會炸開。AI時代真正的分化點是願不願意深度思考,過去的二三倍差距會被放大成幾十倍。

實用技巧與重點

乾貨
  • Karpathy Loop的三個約束
  • One file:Agent只能修改名為train的Python文件
  • One metric:只有一個可打分的數字
  • One time budget:每個實驗有時間限制
  • 具體成果
  • 2天內700個實驗,20個有用改動,訓練時間減少11%,發現自己遺漏的bug
  • SkyPilot版本:16顆GPU集群,8小時910個實驗,成本不到300美金(Claude API約9元,GPU約260元)
  • Tobi Lütke版本:8小時37個實驗,獲得19%的提升
  • Karpathy的核心論述
  • "Your programming now turns to prompting"
  • "That app shouldn't exist"(Software 3.0做出的評價)
  • "You can outsource your thinking, but you cannot outsource your understanding"(訪談最後引用)
  • Agentic Engineering的起點
  • 寫spec時回答三件事:
  • 讓Agent做到什麼
  • 怎麼知道它做對了
  • 出包時回滾到哪裡
  • 如果第二題寫不出來,任務還不夠可驗證。

結論

結論

AI不是讓你少想的工具,而是放大你深度思考ROI的槓桿——願不願意理解底層概念,決定了你在AI時代的天花板。

完整解析

詳細

Karpathy在聖誕假期開始用AI寫代碼時發現了自己的轉變——模型的輸出越來越直接能用,他越來越少親自修改。這次經歷讓他系統化地思考了軟體開發的三個時代。Software 1.0裡人類手寫所有規則;Software 2.0用訓練資料和目標函數生成模型;Software 3.0時代,你不再寫function,而是寫prompt和管理context。他用自己的菜單App說明了這個轉變的威力——那個花了不少工程時間做的App,用戶現在只需直接問Gemini就能解決,整個App根本沒必要存在。這不只是效率問題,而是範式改變了建築遊戲規則的基礎。

然而Karpathy也清晰地指出,AI不是萬能的。他創造了「Jagged Intelligence」這個概念來解釋AI為什麼能在某些領域突飛猛進,卻在簡單常識上犯離譜的錯誤。關鍵在於兩個條件:領域必須可驗證(答案有對錯),實驗室必須把它納入訓練分布。數學和代碼兩個條件都滿足,所以AI能力最強;常識題雖然有對錯但缺乏訓練投入,所以表現較差。理解這一點很關鍵——能驗證的任務可以讓AI跑一百次挑最好的,不能驗證的任務就只能看運氣。

從這個理解延伸出來,真正的Agentic Engineering不是讓AI寫代碼,而是設計一個讓AI安全系統地試錯的環境。Karpathy的Auto Research就是典型案例:他給了Agent明確的邊界(只改一個檔案)、清晰的評分標準(一個metric)、時間限制(一個預算),然後放手。AI在這個被精心設計的「盒子」裡瘋狂試錯,兩天內跑了700個實驗。這種效率的放大遠超傳統的「十倍工程師」描述——一個人指揮一百個agent同時實驗,一晚的產出等於工程師幾個月的嘗試。

但這需要一個根本的轉變:你必須先理解問題本身。Karpathy提到自己的菜單App犯的身份驗證錯誤——Agent用email去配對Google和Stripe帳戶,邏輯看似合理但系統設計完全錯誤。這種錯誤不會在代碼層次被抓出來,因為代碼能跑、測試能過,但在生產環境會慢慢炸開。這就是為什麼底層概念不能外包:API細節可以交給AI記,但Tensor的本質、用戶身份和資金流的設計邏輯,你必須自己理解。AI時代的分化點不在於誰會用AI,而在於誰願意花時間深度思考——過去二三倍的差距在AI時代會被放大成幾十倍甚至百倍。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。