KeyFrame內部研究專用

"Software engineering is not about writing code" — Benoit Schillings, Google DeepMind VP of Research

AI Engineer·7月17日週五·20 min英文

三句話摘要

Google DeepMind研究副總裁分享:機器學習代碼生成已超越人類,軟體工程的未來在於系統設計、安全保證與複雜度管理的新框架。 代碼編寫已死,軟體工程的未來在於如何用ML設計可靠的複雜系統,並在代碼成本趨零的時代確立新的安全、驗證與評估標準。 代碼編寫已不是軟體工程的瓶頸——AI語法生成超越人類,真正的挑戰轉向多步驟系統、架構設計與大規模複雜度管理,這也是為何未來人類角色轉向架構思維與歸納性系統分析。

重點整理

重點
  • 1

    代碼編寫已不是軟體工程的瓶頸——AI語法生成超越人類,真正的挑戰轉向多步驟系統、架構設計與大規模複雜度管理,這也是為何未來人類角色轉向架構思維與歸納性系統分析。

  • 2

    自我對弈模式突破了訓練數據限制——仿效AlphaZero模式,代碼生成模型能自我創造挑戰、自我驗證答案、自我判斷架構品質,透過數億小時的自我對弈生成超越人類的代碼,就像將天才工程師關在房間兩年讓他自我精進。

  • 3

    代碼安全成為首要課題而非事後補救——傳統做法是發現漏洞後修補,但當機器代碼量爆炸時這將無限循環;關鍵是從設計階段教導模型寫出本質安全的代碼,雖然高度依賴上下文但值得投入。

  • 4

    軟體工程的標準與文化必須重塑——既然編寫代碼成本趨近於零,應採用強型別語言或Lean啟發的形式化驗證確保正確性,代碼不需人類可讀,改用多模態思考與視覺化表示,評估指標也要從HumanEval這類狹隘基準轉向文本壓縮等開放式問題。

實用技巧與重點

乾貨
  • 時間與背景:
  • Pitchfork項目:2018年於Google X啟動
  • 當時業界認知:ML用於代碼編寫無必要
  • 演講者經歷:45年編程生涯(蘋果II/Commodore 64組合語言→C++→Python→AI編碼)
  • 數據與現狀:
  • GitHub上80%新代碼已由機器生成
  • 人類大腦上下文能力:7-9個token
  • ML模型上下文:即將趨近無限
  • 技術模式:
  • AlphaZero模式用於代碼自我對弈
  • Gemini多模態設計支持空間與動態表示
  • 自我對弈時間:數億小時規模
  • 評估與驗證工具名稱:
  • HumanEval基準(被評為不足)
  • 建議替代:文本壓縮問題(測量壓縮效率bits per character)
  • 新型語言特性:
  • 強型別語言
  • Lean啟發的形式化驗證
  • 無需人類可讀性
  • 應用領域:
  • 化學(20+原子分子特性未知→10000原子接近生命)
  • 生物(破解自然工程的文檔不足)
  • 物理與其他被人類偏見遮蔽的領域

結論

結論

代碼編寫已死,軟體工程的未來在於如何用ML設計可靠的複雜系統,並在代碼成本趨零的時代確立新的安全、驗證與評估標準。

完整解析

詳細

Benoit Schilling 從Google X轉入Google DeepMind,帶領一支致力於未來一個月到一年內開發Gemini所需技術的研究團隊。他回顧了2018年與同事啟動的Pitchfork項目,當時業界普遍懷疑——為什麼需要ML寫代碼?他坦承自己也經歷過類似的技術抗拒,45年編程生涯中從組合語言到C++再到Python,每次轉變都遭過質疑。最終他領悟:即使老狗也能學新把戲,關鍵在於理解時代變遷。

軟體發展經歷三個時代。組合語言時代,機器性能是瓶頸,程序員須榨取每一分算力。雲計算時代,算力廉價,瓶頸轉向設計與模塊化——如何優雅分解問題、構建長期可維護的系統。而人類大腦上下文只有7到9個token,這決定了軟體工程的許多實踐。現在進入AI時代,編寫代碼不再是難題,真正的瓶頸變成:如何確保生成的代碼確實符合需求?這是一場從代碼編寫到系統架構的根本轉變。

代碼之所以成為ML研究的焦點,在於兩大特性:數據量豐富(GitHub隨處可得)且可驗證(可編譯、可測試)。然而當今困境是GitHub上80%新代碼已由機器生成,人類知識來源正在枯竭。突破口是自我對弈——仿效AlphaZero模式,代碼生成模型能創造自己的挑戰、驗證答案、評估架構,透過數億小時的自我對弈超越人類。這如同將天才工程師鎖在房間兩年,給他們披薩與自我提升的使命——他們會創造可驗證的挑戰並反覆磨練。模型正做著同樣的事。

隨著代碼編寫成本趨近零,將產生爆炸性增長的代碼量,帶來深刻挑戰。首先是安全性——傳統修補漏洞方法將陷入無限循環,需要從設計階段教導模型編寫本質安全的代碼。其次是評估標準——HumanEval只驗證程式運行與輸出,忽視軟體工程全貌,應引入文本壓縮等開放式問題迫使模型創新。再者,代碼應支持多模態思考與空間表示,而非純token序列。最後,既然編寫成本消失,不妨採用強型別語言或Lean啟發的形式化驗證提高安全性——代碼無需人類可讀。這些突破在代碼與化學、生物、物理交叉應用中尤其激動人心,未來將浮現人類感知不到的創新解決方案。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。