KeyFrame內部研究專用

fighting slop with slop — Vaibhav Gupta, Boundary

AI Engineer·7月31日週五·21 min英文

三句話摘要

超越代碼審查:用工具與設計而非人力審查確保系統穩定性,以及為 AI 時代重新設計的新程式語言 BAML。 不是用人力審查代碼確保品質,而是用工具、設計與系統化驗證來建立複雜系統的信任——AI 時代的工程實踐需要重新思考底層假設。 用不變性工具取代程式碼審查 — 不是讓人去讀代碼,而是建立 CLI 工具監控架構規則(語義邊界、依賴關係圖),確保某些設計決策不被破壞。當新包被添加或依賴有漏洞時,CI/CD 會自動告訴你問題在哪裡。

重點整理

重點
  • 1

    用不變性工具取代程式碼審查 — 不是讓人去讀代碼,而是建立 CLI 工具監控架構規則(語義邊界、依賴關係圖),確保某些設計決策不被破壞。當新包被添加或依賴有漏洞時,CI/CD 會自動告訴你問題在哪裡。

  • 2

    設計文件必須比代碼更嚴謹 — 代碼可以粗糙,寫作不能粗糙。通過設計工具 + Slack 整合每次更新都推送通知,使設計文件成為公司最受歡迎的溝通管道。引入「必須有人真正讀過才能發佈」的規則,自動提升品質。

  • 3

    代理驗證系統取代人工檢查 — 讓 AI 代理持續生成、測試 BAML 程序,再由另一個代理檢查是否有錯誤(語言缺陷、重複工具調用、邏輯漏洞),通過 A/B 測試找出最優特徵,無需編寫任何代碼就能建立資料驅動系統。

  • 4

    從第一原理重新設計語言特性 — TypeScript 繼承了 JavaScript 的深層缺陷(分類轉字串、類型推斷漏洞)。BAML 內建強型別錯誤處理(like Rust),編譯器自動推斷函數會拋出哪些異常,保證處理完整性;支援跨語言調用(Python、TypeScript、Rust、Go、Java),傳遞 lambda、泛型、閉包都有型別保證。

實用技巧與重點

乾貨
  • 團隊規模對比:傳統開發語言需 8 人、2 年以上、數千工時,BAML 只需數百萬個代幣
  • 設計文檔工具功能:版本控制、評論功能、Slack 整合推送、Markdown 支持、類似 GitHub 的 CLI 腳本
  • 監控工具
  • 依賴關係圖視覺化(內部+外部依賴)
  • 架構規則檢查(語義邊界、包隔離)
  • 代理驗證流程
  • 代理生成 BAML 程序
  • 另一個代理檢查錯誤類型、工具調用次數、結果正確性
  • 人類確認真實 vs 幻覺
  • A/B 測試找最優特徵
  • BAML 核心特性
  • 自動錯誤型別推斷(函數知道會拋出哪些異常)
  • 編譯時錯誤處理保證
  • 跨語言互操作(Python→TypeScript→Rust,型別安全)
  • 傳遞 lambda、泛型、閉包跨語言邊界
  • 執行追蹤系統(每個文件含追蹤,代理可審查代碼缺陷與優化機會)
  • 可編譯成獨立 CLI 二進位(WASM 兼容,跨 Windows/Mac/Linux)
  • 具體例子:工程師用 BAML 完全構建了部分 C 編譯器

結論

結論

不是用人力審查代碼確保品質,而是用工具、設計與系統化驗證來建立複雜系統的信任——AI 時代的工程實踐需要重新思考底層假設。

完整解析

詳細

Vaibhav 來自 Bemo,他分享了一個反直覺的工程實踐:他們開發新程式語言 BAML 時不做傳統程式碼審查,而是依賴自動化工具與系統設計來確保品質。這個選擇源於一個現實:試圖雇用頂尖工程師卻無法統一他們使用的工具與標準(有人想用 Claude、有人想用 Codex),與其強制標準,不如賦予自由。

為了管理這種自由帶來的複雜性,他們建立了三層防禦。首先是架構文件層:一份極小、幾年不變的 `architecture.md` 檔案,只記載編譯器各層結構。任何 AI 代理都能讀懂,新人深入編譯器前必須先與另一位成員溝通。其次是設計層:他們開發了一套設計文件工具(版本控制、評論、Slack 整合),每當設計更新時主動推送到公司頻道。這個工具意外地成為最活躍的溝通方式——凌晨 2 點有人發設計文件,三個人立刻開讀,因為它有趣且不常改變。引入「必須有人真正讀過才能發佈」的規則後,文件品質飛升。第三層是架構監控:一個依賴關係圖工具視覺化程式碼庫,搭配 CLI 檢查規則(包隔離、語義邊界),確保不變式不被破壞。

最革新的部分是驗證層。他們讓 AI 代理持續生成 BAML 程序,再用另一個代理檢查——不僅找出語言缺陷,還分析工具調用次數、是否重複、邏輯漏洞。通過 A/B 測試,他們能確定性地知道哪些特徵減少工具調用、減少錯誤、提高準確率。人類的角色變成判斷「這是真實 bug 還是幻覺」。這樣做的好處是:無需編寫任何代碼就能建立資料驅動的優化系統,傳統上需要 8 人、2 年、數千工時的開發工作只需數百萬代幣。

但 Vaibhav 坦言,現有工具都有底層缺陷。他以 TypeScript 為例:它繼承了 JavaScript 的問題。為什麼分類時要轉成字串?為什麼類型推斷會失敗?這不是 TypeScript 的錯,而是 JavaScript 先存在,然後人們試圖在它上面疊加。BAML 的解法是從第一原理設計:強型別的錯誤處理(如 Rust)。當一個函數呼叫 divide 函數,而 divide 會拋出「除以零」錯誤,編譯器自動推斷該函數也會拋出這個錯誤,無需手寫;捕捉或處理錯誤時編譯器可證明你是否處理完整。跨語言互操作也內建其中:Python 代碼可呼叫 BAML 函數完全型別安全,傳遞 lambda、泛型、閉包都經過型別檢驗,不需要額外封裝。執行追蹤系統記錄每次函數調用的耗時,代理無需讀代碼就能通過追蹤找出效能瓶頸與邏輯錯誤。

他強調,這不是要全世界重寫所有代碼。BAML 的價值在於可從任何語言調用,作為現有系統的補充,而非替代。最後他呼籲工程師回家後建立這些「粗糙工具」強化系統穩健性,同時鼓勵勇敢者思考底層系統哪裡出錯,可能需要新的 Git、新的資料庫、新的程式語言。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。