AI 時代工程師怎麼重新定位自己:Andrej Karpathy 訪談解析
三句話摘要
AI時代程序員該如何重新定位自己——從Software 3.0、Jagged Intelligence到Agentic Engineering的三層框架。 AI不是讓你少想的工具,而是放大你深度思考ROI的槓桿——願不願意理解底層概念,決定了你在AI時代的天花板。 Software 3.0的典範轉移
重點整理
重點- 1
Software 3.0的典範轉移
- 2
傳統軟體(Software 1.0)是人寫規則讓電腦執行;神經網路時代(Software 2.0)是訓練模型自動習得規則;現在(Software 3.0)是寫提示詞和管理上下文來指揮AI助理。Karpathy用自己的菜單App為例,發現用戶只需直接把照片丟給Gemini就能解決問題,整個App其實不需要存在——Software 3.0不是把舊東西做快,而是讓以前不可能的事現在能做到。
- 3
Jagged Intelligence的認知邊界
- 4
AI的能力分布像鋸齒狀而非平滑曲線。數學和代碼能力強因為答案可驗證且實驗室投入訓練;常識題較弱因為難以驗證且訓練資料投入少。這不是AI本身的限制,而是實驗室的產品決策——能驗證的領域可用強化學習讓AI跑百次實驗挑最好的,不能驗證就只能祈禱運氣。
- 5
Agentic Engineering vs Vibe Coding
- 6
Vibe Coding拉高所有人的下限(不會寫代碼也能做出工具),但Agentic Engineering決定你的上限(設計驗證機制、邊界約束、回滾策略,讓AI安全系統地試錯)。Karpathy的Auto Research範例:設置三個約束(只改一個文件、一個評分指標、時間預算),讓AI自動跑700個實驗、找到20個有用改動、縮短11%訓練時間。這不是十倍效率,而是指數級的放大。
- 7
理解不能外包,細節可以
- 8
API細節、Boilerplate、支付邏輯交給AI記,但Tensor的本質、用戶身份設計、資金歸屬邏輯必須自己理解。Karpathy舉例菜單App的身份驗證漏洞——AI的代碼能跑能測試通過,但系統設計在生產環境才會炸開。AI時代真正的分化點是願不願意深度思考,過去的二三倍差距會被放大成幾十倍。
實用技巧與重點
乾貨- Karpathy Loop的三個約束
- One file:Agent只能修改名為train的Python文件
- One metric:只有一個可打分的數字
- One time budget:每個實驗有時間限制
- 具體成果
- 2天內700個實驗,20個有用改動,訓練時間減少11%,發現自己遺漏的bug
- SkyPilot版本:16顆GPU集群,8小時910個實驗,成本不到300美金(Claude API約9元,GPU約260元)
- Tobi Lütke版本:8小時37個實驗,獲得19%的提升
- Karpathy的核心論述
- "Your programming now turns to prompting"
- "That app shouldn't exist"(Software 3.0做出的評價)
- "You can outsource your thinking, but you cannot outsource your understanding"(訪談最後引用)
- Agentic Engineering的起點
- 寫spec時回答三件事:
- 讓Agent做到什麼
- 怎麼知道它做對了
- 出包時回滾到哪裡
- 如果第二題寫不出來,任務還不夠可驗證。
結論
結論“AI不是讓你少想的工具,而是放大你深度思考ROI的槓桿——願不願意理解底層概念,決定了你在AI時代的天花板。”
完整解析
詳細Karpathy在聖誕假期開始用AI寫代碼時發現了自己的轉變——模型的輸出越來越直接能用,他越來越少親自修改。這次經歷讓他系統化地思考了軟體開發的三個時代。Software 1.0裡人類手寫所有規則;Software 2.0用訓練資料和目標函數生成模型;Software 3.0時代,你不再寫function,而是寫prompt和管理context。他用自己的菜單App說明了這個轉變的威力——那個花了不少工程時間做的App,用戶現在只需直接問Gemini就能解決,整個App根本沒必要存在。這不只是效率問題,而是範式改變了建築遊戲規則的基礎。
然而Karpathy也清晰地指出,AI不是萬能的。他創造了「Jagged Intelligence」這個概念來解釋AI為什麼能在某些領域突飛猛進,卻在簡單常識上犯離譜的錯誤。關鍵在於兩個條件:領域必須可驗證(答案有對錯),實驗室必須把它納入訓練分布。數學和代碼兩個條件都滿足,所以AI能力最強;常識題雖然有對錯但缺乏訓練投入,所以表現較差。理解這一點很關鍵——能驗證的任務可以讓AI跑一百次挑最好的,不能驗證的任務就只能看運氣。
從這個理解延伸出來,真正的Agentic Engineering不是讓AI寫代碼,而是設計一個讓AI安全系統地試錯的環境。Karpathy的Auto Research就是典型案例:他給了Agent明確的邊界(只改一個檔案)、清晰的評分標準(一個metric)、時間限制(一個預算),然後放手。AI在這個被精心設計的「盒子」裡瘋狂試錯,兩天內跑了700個實驗。這種效率的放大遠超傳統的「十倍工程師」描述——一個人指揮一百個agent同時實驗,一晚的產出等於工程師幾個月的嘗試。
但這需要一個根本的轉變:你必須先理解問題本身。Karpathy提到自己的菜單App犯的身份驗證錯誤——Agent用email去配對Google和Stripe帳戶,邏輯看似合理但系統設計完全錯誤。這種錯誤不會在代碼層次被抓出來,因為代碼能跑、測試能過,但在生產環境會慢慢炸開。這就是為什麼底層概念不能外包:API細節可以交給AI記,但Tensor的本質、用戶身份和資金流的設計邏輯,你必須自己理解。AI時代的分化點不在於誰會用AI,而在於誰願意花時間深度思考——過去二三倍的差距在AI時代會被放大成幾十倍甚至百倍。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


