2026 State of AI Engineering — Barr Yaron, Amplify Partners
三句話摘要
2026年AI工程師現狀調查:從實驗走向生產,成本與控制成新課題 AI工程正從探索期快速進入生產期,Agent成為實際決策者、成本成為一流約束、但基礎控制機制仍顯原始——這是增長與風險並存的轉折點,要求工程文化的深度調整。 模態邊界擴展但仍有層級:文字仍占絕對主導,但圖像生成已從18%翻倍到36%真正進入生產環境,反映模型質量臨界點已跨越。音頻雖未廣泛使用,56%的非使用者計劃採用,延續去年37%的趨勢加速,這是最強的採用信號。
重點整理
重點- 1
模態邊界擴展但仍有層級:文字仍占絕對主導,但圖像生成已從18%翻倍到36%真正進入生產環境,反映模型質量臨界點已跨越。音頻雖未廣泛使用,56%的非使用者計劃採用,延續去年37%的趨勢加速,這是最強的採用信號。
- 2
多模型混合成標配,標準化在上層:87%團隊使用多個模型按任務類型路由,開源模型作為閉源的補充而非替代品。組織試圖在平台工具層面而非模型層面標準化,因為發現不同模型擅長不同任務,單一選擇反而成本更高。
- 3
成本從虛到實的轉變:40%受訪者稱成本定期影響使用雄心,36%稱有時影響,75%整體受成本驅動。成本監控已升至生產SLA第二位(僅次於質量),這是過去一年最顯著的新信號,直接影響工程師選擇模型和功能搭配的方式。
- 4
Agent進入實戰但缺乏成熟控制:95%採用Agent(去年48%),89%可寫入數據(去年52%),意味著Agent從讀寫升級為系統內行動者。但控制機制仍依賴人工審批與權限管理等初級工具,2/3工程師仍因幻覺和上下文丟失而沮喪,反映控制層尚未成熟。
實用技巧與重點
乾貨- 調查基礎
- 受訪者:1,048名AI工程師
- 經驗分布:50%以上10年+軟體經驗者AI經驗<3年;最新工程師AI經驗中位數≈10年資深工程師
- 模態採用數據
- 文字:主導(具體比例未明,但領先其他模態)
- 圖像生成:18%→36%(翻倍),相關模型包括DALL-E 3、Grok、ChatGPT Images 2.0、Nano Banana 2
- 音頻意願:56% intent to adopt(去年37%,加速中)
- 模型選擇
- 閉源模型使用率:94%
- 開源模型使用率:45%
- 同時使用兩者:90%(開源作補充而非替代)
- 模型選擇前三考量:質量(dominates)→Tool Calling等能力→成本(開源vs閉源僅5%提及)
- 團隊使用多模型比例:87%
- Agent採用與權限
- Agent使用率:95%(去年~48%)
- 具寫入權限Agent比例:89%(去年52%)
- 全體受訪者使用具寫入權限Agent比例:vs去年增長3倍
- 成本影響
- 定期影響使用雄心:40%
- 有時影響:36%
- 總體受成本驅動:75%
- 生產監控優先級:成本&Token usage排第二(僅次於質量)
- 技術棧挑戰排序
- 第一名:Evals(連年領先,margin縮小中)
- 後續:監控指標散亂,96%受訪者同意存在某種棧問題
- 構建 vs 購買
- 購買最多:Inference & 模型服務
- 自建最多:Prompt管理(61%自建)、RAG、Evals
- 未決態:Fine-tuning(大多未啟動)
- 組織影響
- 淨正面效應:97%
- 淨負面效應:90%+(深層技能流失、代碼庫理解下降)
- AI模糊角色邊界:81%
- 非開發者發佈功能:34%的團隊(多為內部)
- 非開發者定期發佈客戶面向功能:17%
- 工作與未來展望
- 工作滿意度提升:76%
- 長期負債隱憂:59%
- 五年內實驗室宣布AGI:67%預期會發生
- Transformer在五年後仍為SOTA:9%押注
- 空間vs陸地AI計算五年後比例:36% space > land,38% land > space(最具爭議)
結論
結論“AI工程正從探索期快速進入生產期,Agent成為實際決策者、成本成為一流約束、但基礎控制機制仍顯原始——這是增長與風險並存的轉折點,要求工程文化的深度調整。”
完整解析
詳細Amplify投資公司合夥人Bar Yarin每年進行AI工程現狀調查,2026年共收集1,048名工程師的回應。調查首先呈現一個發現:AI工程正在演變為跨越職能邊界的學科。受訪者既有軟體業資深人士轉身學習新範式,也有從未經歷過無AI世界的新手工程師,經驗層級與背景差異極大。這反映出AI能力已不再是專項職位,而是影響從創辦人到CTOs的普遍技能。
在實際應用層面,文字仍然是AI產品的核心基礎,但增長最快的是圖像生成。過去一年內,生成式圖像的使用者從18%上升至36%,幾乎翻倍,並與DALL-E 3、ChatGPT Images 2.0等模型的重大迭代同步發生。這表明圖像能力已從實驗玩具躍升至生產級別。更有趣的是音頻的信號——雖然當前使用者占比不高,但在未使用音頻的工程師中,56%明確表示計劃採用,這個數字比去年的37%有明顯加速。這種「intent to adopt」最高的狀態預示著音頻將是下一波主流採用的浪潮。
模型選擇的故事尤其值得關注,因為它打破了Twitter圈子裡的「開源vs閉源」二元論。調查顯示,94%的團隊使用閉源模型,45%同時使用開源模型,但最關鍵的是,90%同時使用兩者的團隊將開源視為補充而非替代品。當被問及選擇模型的核心考量時,質量絕對主導(沒有比較),其次是Tool Calling等智能化能力,第三是成本。相反地,「開源vs閉源」這個在技術論壇上激烈爭論的問題,僅被5%的受訪者列為前三考量——實務決策遠比意識形態務實。事實上,87%的團隊在生產中使用多個模型,按任務特性路由或比較輸出結果,這已經成為標配策略。組織開始嘗試平台與工具層面的標準化而非模型層面,因為發現試圖只用一個模型往往無法達到最優成本與質量的平衡。
成本管理的變化最值得重視。12個月前,成本還不是工程師討論的主流話題,但今年40%的受訪者說成本定期影響他們使用AI的雄心程度,另外36%表示有時會影響。換言之,75%的工程師已經在根據成本調整使用策略。這不是抽象討論,而是真實限制——在生產監控項目中,成本與Token使用已躍升至第二位重要指標(僅次於質量),與SLA並列監控。這直接改變了工程師的架構選擇,從「要什麼功能」轉變為「能用什麼預算實現什麼」。
Agent的演進是本年最戲劇化的轉變。95%的團隊現在使用Agent,相比去年的約48%直接翻倍。但更關鍵的是權限的升級:具有數據寫入權限的Agent從去年52%升至89%。這意味著Agent已經從「讀取與總結資訊」轉變為「在實際系統內採取行動」。把兩個變化結合,全體受訪者中使用具寫入權限Agent的比例相比去年增長超過三倍——這是從demo級走向生產級的真實跨越。但問題隨之而來:如何控制這些自主行動的系統?調查顯示,大多數團隊仍依賴人工審批與權限管理——本質上是用管理實習生的工具來管理AI Agent。下層則是各種實驗性嘗試:任務分解、檢索增強、內存管理、沙箱隔離,但沒有一種方案已成為行業標準。2/3的工程師表示,幻覺(hallucination)和mid-task上下文丟失是最大挫折,反映出控制層仍未成熟。
技術棧層面,Eval持續多年排名第一大挑戰,但有趣的是margin正在縮小——這可能意味著其他問題正在浮出水面。實際上,96%的受訪者都同意存在某種棧問題,只是無法達成共識。在構建vs購買的取捨上,模式相當清晰:Inference與模型服務是最多被購買的層(因為構建推理基礎設施成本與複雜度高),而Prompt管理(61%自建)、RAG、Evals等靠近產品邏輯的層則傾向自建——因為每個組織的需求獨特,很難用通用產品滿足。Fine-tuning則處於「還不成熟」態,大多團隊尚未探索。
在組織層面的影響,97%報告AI帶來淨正面效應,但核心不只是「速度」,而是「廉價失敗」——實驗變得幾乎免費,原型數倍增加,團隊願意下更多小賭注。但硬幣另一面同樣真實:90%以上感受到負面下游效應,最普遍的是深層技術技能流失和對代碼庫理解下降——廉價代碼生成的必然代價。更激進的轉變發生在組織邊界本身:81%表示AI正模糊工程師與產品/行銷角色的界線。軟體發佈曾經是工程師的獨占領地,但現在34%的團隊有非開發者發佈功能(大多數是內部工具或小範圍實驗),17%甚至定期讓非開發者發佈客戶面向功能。這表明AI民主化已經真實發生,不再是未來可能。
展望未來,76%的工程師表示AI提升了工作滿足感,但同時59%擔心今日構建的AI代碼將帶來長期負債——這是增長與風險並存的真實寫照。五年預測中,67%預期某家領導實驗室會宣布實現AGI(需注意:調查問的是宣布press release,不是實現本身),但只有9%押注Transformer在五年後仍為最先進架構,多數人態度是「未確定」或傾向於新架構。調查中最具爭議的問題(也最具趣味)是「未來五年空間內的AI計算會否超過陸地」,結果近乎平分:36%認為會,38%認為不會,反映出對AI計算地理分佈的根本不確定。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


