KeyFrame內部研究專用
每日

今日 KeyFrame

管線分析的每一部影片,最新的優先。每張卡片都直接連回原始影片。

7月7日星期二

30
用什么Fable 5?都给我去用国产模型|顶级模型变奢侈品,普通人怎么用 AI?
24 min
AI 技術中文7月7日

用什么Fable 5?都给我去用国产模型|顶级模型变奢侈品,普通人怎么用 AI?

人民公园说AI

  • 頂級模型可用性崩壞:OpenAI推出GPT-5.6後只開放20個合作夥伴,普通用戶被限制在GPT-5.5和Opus 4.8。模型部署了多層安全過濾機制(講者稱「切腦」),明面有一層審查,暗處還有一層,導致用戶的合理需求經常被路由到更低能的模型去回答。
  • 國產模型已被實際驗證:Coinbase(金融上市公司,對準確性要求最高)已用GLM和Kimi處理大部分編碼任務,費用降至原來的一半以下。這表明國產模型在生產環境中已足夠可靠,且性價比遠優於國外模型。
  • 用戶痛點是碎片化,不是單個模型:小企業主和獨立開發者不想在模型間頻繁切換、維護上下文、重新計算成本。他們期待一個統一的月費制方案(講者建議500元/月),能內置三到五個模型,系統自動分配和切換,只讓用戶專注業務邏輯。
What’s next in IAM: Security, governance, and runtime defense for AI agents
36 min
AI 技術英文7月7日

What’s next in IAM: Security, governance, and runtime defense for AI agents

Google Cloud Events

  • 非人類身份已達人類身份的82倍,但42%的agents擁有敏感操作權限過度——傳統IAM是為2010年代的人類設計,agents需要從零開始構建防禦深度,而非迭代添加,因為97%人類用戶不會觸發其獲得的權限,agents卻必定會。
  • Principal Access Boundary(PAB)層級制約優於所有其他政策——演示中,agent儘管擁有compute instance admin,因ENV:PROD標籤上的deny rule仍無法刪除生產VM,展示防禦縱深的實際效用。
  • AI Security Posture提供無代理、開箱即用的發現與威脅檢測,包含206個軟體漏洞、privilege escalation偵測、模型護甲違規——讓安全團隊實時掌握整個agent生態的風險。
THE LILY JAY FILES | CHARITY SCAM? | AI MANIPULATION OR NOT? | TRANSPARENCY @LilyJay
14 min
AI 技術英文7月7日

THE LILY JAY FILES | CHARITY SCAM? | AI MANIPULATION OR NOT? | TRANSPARENCY @LilyJay

Bro Hajji

  • AI 生成內容的證據確鑿:ABC News 透過數位分析發現視頻存在多個造假跡象,包括視窗位置移動、簽名在手上閃爍等數位編輯痕跡,甚至 Lily J 宣稱獲得的人道主義獎項也是 AI 生成的虛構內容,根本不存在。
  • 缺乏法律與監管合規:該基金會自我描述為「下一代社會企業」和「高速人道主義物流公司」,但未向澳洲慈善委員會(ACNC)註冊。這是紅旗警訊,違反了合法慈善機構應有的標準。
  • 穆斯林慈悲心遭系統性利用:加沙戰爭期間,利用穆斯林的情感與慷慨募集鉅款,但募款金額及使用細節完全不透明。講者指出穆斯林社群太容易被感動而捐款,這已成為被詐騙的常態。
The Pipeline Is Dead - Iris ten Teije, Sky Valley Ambient Computing
19 min
GitHub 熱點英文7月7日

The Pipeline Is Dead - Iris ten Teije, Sky Valley Ambient Computing

AI Engineer

  • 成本轉移帶來架構轉變。從前製作軟體昂貴且罕見,所以一次編譯、凍結、分發給所有人是必然選擇。如今生成成本趨零,改動可即時在任何地方執行,這消解了「開發和分發分離」的經濟理由,導致軟體不再需要凍結成單一成品。
  • 用戶一直渴望個性化軟體。企業軟體客製化、個人的編輯器設定、Excel 的用戶自建應用,都證明人們樂於掌控自己的工具。過去不可行只是因為成本太高;現在技術成熟,按用戶個性化軟體變得可行。
  • 架構透過「主幹+隔離版本」控制風險。不是丟給開發者一百萬個獨立成品去維護,而是發布一個規範主幹,讓每個用戶執行自己的隔離變體。每個版本不變、可檢查、可溯源;壞變體無法汙染主幹或他人版本;任意變體可即時回滾。
500 people vibe-coded for 30 days. I was one of them. - Sanja Grbic, Automattic
17 min
AI 技術英文7月7日

500 people vibe-coded for 30 days. I was one of them. - Sanja Grbic, Automattic

AI Engineer

  • AI 工具破除了職能壁壘,使非工程師能撰寫並推送生產代碼。設計師不再侷限於設計工具與交付給工程師的設計稿,而是能夠直接擁有整個技術實現過程,成為 design engineer。
  • 高級技能持有者的槓桿來自於啟用他人而非自我執行。工程師幫助他人學習 Git 工作流、設置開發環境,其長期影響遠大於自己多做工程工作,這種「使能者」角色對所有職能都適用。
  • 團隊流程會圍繞可用工具重塑。當 AI 提高了代碼產出速度後,團隊從 Figma-first 轉為快速原型化,邊建構邊對齊,最後才進行視覺微調,大幅壓縮交付時間。
​你竟然還不用?Google Gemini 繁體中文終極教學:教你用 AI 變身職場強者!
5 min
AI 技術中文7月7日

​你竟然還不用?Google Gemini 繁體中文終極教學:教你用 AI 變身職場強者!

Appztalk

  • 自動尺寸調整與平台適配:告訴 Gemini 是 YouTube、Instagram 還是 Facebook,它會自動產生該平台的正確尺寸縮圖,省去手動調整的步驟。
  • 疊層編輯能力:不滿意初版縮圖可以追加要求(如「多放一些菜」),Gemini 會在原圖基礎上繼續修改,也支援嵌入自己的照片。
  • 內容生成一條龍:除了生成縮圖,還能產生適合貼在 YouTube Description 欄位的文案描述。
語音輸入 x AI 怎麼用? AI 時代最被低估的工作技能! ft. Typeless
12 min
AI 技術中文7月7日

語音輸入 x AI 怎麼用? AI 時代最被低估的工作技能! ft. Typeless

Gary Chen

  • 效率與 Context 豐富度的雙重優勢
  • 語音輸入不只是速度快,更重要的是打字有心理摩擦力,你會自動精簡想法。講話則幾乎無摩擦,背景資訊、細節、甚至那些你以為不重要的小事都能自然流出,而這些看似無關的細節正是定義品味、決定 AI 輸出是否符合預期的關鍵。
  • 保持專注的隱性成本
How To Use Claude for Small Businesses
25 min
AI 技術英文7月7日

How To Use Claude for Small Businesses

Mikey Vibe Coding

  • Claude在Base44中扮演「建設者」角色,不只是聊天助手,能生成可用的完整應用系統。大多數人只用它的5%功能(查詢或校對),掌握建設方法後才能發揮真正價值。
  • 迭代策略優於一次性大改。先產生初版、檢視結果、針對單一部分改進、再次檢視,這種小步驟反覆循環比試圖同時改十件事更能產生優質結果。
  • 三個系統形成閉環的業務流程:官網吸引客戶→內部管理工具組織資訊→自動化系統維持客戶關係,三層相互支撐,替代多個分散的付費工具。
How To Fully Automate Video Editing with Claude Code (Setup + Guide)
10 min
AI 技術英文7月7日

How To Fully Automate Video Editing with Claude Code (Setup + Guide)

Zinho Automates

  • 自動轉錄與精確剪輯:11 Labs Scribe 將原始素材轉錄並標註每個詞的起訖時間戳,Claude 據此自動刪除死空間、填充詞(um、like)、重複句子和長停頓,確保剪輯點準確無誤,不會斷詞或切掉語音。
  • 分層工作流程:VideoUse 負責編輯邏輯,Hyperframe 負責圖形渲染,ffmpeg 處理最終合成,三者緊密整合但用戶無需直接操作,Claude 統一協調。
  • 創意控制的 80/20 分割:Claude 自動生成初稿(包括粗剪、圖形規劃、字幕、配樂),用戶只需調整顏色、速度、標誌位置等細節,每次修改只重新渲染該部分,反覆迴圈快速。
How to Turn Any Photo into a Cinematic AI Music Video | FlyU AI Tutorial
8 min
AI 技術英文7月7日

How to Turn Any Photo into a Cinematic AI Music Video | FlyU AI Tutorial

Techvid Ai

  • 多模型整合與靈活選擇:平台整合 Seedance 2.0、Kling 3、VO3、Sora 2、Happy Horse、Gemini Omni 等多個 AI 引擎,用戶無需在不同工具間切換即可對比使用,Seedance 2.0 特別適合平滑鏡頭運動和高品質電影敘事。
  • 自動故事生成的核心價值:Story 模式能根據上傳的照片和音樂自動分析氛圍、生成完整的電影級故事情節和視覺場景,特別適合處理情感記憶、家庭照片或關係時刻。
  • 內建音樂創作能力:平台提供 AI 音樂生成功能,用戶可直接撰寫提示詞(如「柔和鋼琴、弦樂和懷舊旋律」)生成原創配樂,無需預先準備音樂文件。
Everyone is talking about Loop Engineering... but no one explains it like this
31 min
AI 技術英文7月7日

Everyone is talking about Loop Engineering... but no one explains it like this

Simone Rizzo

  • 上下文溢出是瓶頸:Context Rot 現象指出當輸入超過 20 萬個 token 時,模型效能急劇下降。Harness Engineering 通過將任務狀態寫入檔案(Memory.md、Agent.md)而非存在上下文中,解決了反覆緊縮上下文的性能損耗。
  • 迴圈嵌套是核心:Loop Engineering 是三層迴圈結構——模型內部迴圈(工具調用)、Harness 迴圈(任務步驟)、以及最外層的自動迴圈(觸發→執行→驗證→下一週期),使代理能在無人干預下持續改進。
  • 目標設定需可驗證:迴圈必須有明確的結束條件,分為五個驗證層級:布林值(編譯成功/否)、規則與指標(網頁載入 <100ms)、延遲驗證(需等待結果才能判定)、LLM 評判(由模型打分)、以及保險絲(最多嘗試次數或時間限制)。
Secure your Agent Harness with Code Sandboxing
25 min
AI 技術英文7月7日

Secure your Agent Harness with Code Sandboxing

MasterDotDev

  • 工具呼叫 vs. 程式碼執行的效率差異:連續使用 12 個不同工具需要 12 個回合、12 次令牌消耗,代理改為撰寫一段程式碼將這些工具串聯,能同時獲得所有答案,減少等待時間和令牌使用。
  • 代理程式碼執行的安全隔離:不能直接在生產環境執行代理生成的程式碼,必須建立隔離的沙箱環境(如 Node VM)來防止程式碼逃逸或對系統造成傷害,確保在生產環境前的離線測試也要遵守此原則。
  • 發揮語言模型的最佳能力:語言模型在程式碼撰寫上表現優異,但在算術和數字推理上容易產生幻覺。透過讓代理撰寫確定性程式碼(而非純推理)來完成計算工作,能同時利用其強項並避免弱點。
一口气讲完12个Agent的底层原理,从message到多Agent,全程干货,建议收藏!
8 min
AI 技術中文7月7日

一口气讲完12个Agent的底层原理,从message到多Agent,全程干货,建议收藏!

白白说大模型

  • 對話與記憶機制:AI的每次對話請求都是全新開始,它沒有真正的記憶。所謂"記得"前面的內容,完全是因為系統把整個對話歷史以message數組格式重新塞給它。這就是上下文窗口的本質,也解釋了為什麼對話越長成本越高。
  • 角色塑造與思維鏈:System Prompt通過定義人設(如"你是一個挑剔的老板")立即改變AI的回複風格;Chain of Thought提示("請一步一步地算")讓AI按步驟推理而非直接蒙答,能使數字計算和複雜推理的准確率爆炸性提升。
  • 格式控制三層防護:Few-shot提示(給3-5個完整例子)讓AI理解輸出模式;預填充(預先寫好開頭字符如{)阻止AI選擇其他開頭方式;停止序列(設定"觀察"等標志符)強制AI在指定位置停止,防止自行編造工具結果。
Claude 在作弊?Anthropic 发现 AI 知道自己被"操纵"  解读最新A厂全局工作空间论文
10 min
AI 技術中文7月7日

Claude 在作弊?Anthropic 发现 AI 知道自己被"操纵" 解读最新A厂全局工作空间论文

Why QQ

  • 工作空間的發現與驗證:研究團隊將神經科學的「全域工作空間理論」應用到大模型,發現 Claude 內部自發形成了類似人腦的信息共享結構。透過 JLens 技術而非直接觀察模型輸出,他們首次系統性地讀取了模型內部表徵,證明大模型的思考並非只發生在表面輸出層。
  • JSpace 的五大特性證實了內部推理的存在:可報告性表明 JSpace 內容可被精確操縱;並行處理說明模型能同時在心裡做算數和抄寫;內部推理證實多步問題的中間步驟在隱藏層完成;泛化能力表明概念儲存在共享記憶中;選擇性則說明 JSpace 是靈活計算的專用通道,而非全能。
  • 破解 AI 對齐的新視角:傳統方法只看模型說了什麼,無法察覺隱藏意圖。透過監控 JSpace,研究者發現模型在執行不當行為時會出現特定表徵(如「操縱」「虛偽」),這為安全監控和反事實反思訓練提供了直接干預點。
Your Pre-work for the AI Business Summit! July 8-11, 2026
9 min
AI 技術英文7月7日

Your Pre-work for the AI Business Summit! July 8-11, 2026

Alicia Lyttle

  • 隱私保護優先:在 ChatGPT 和 Claude 上都需關閉「改進模型訓練」功能,防止輸入的內容被用於模型訓練。這是講者特別強調的重點,要求參與者在登錄後立即進入設置完成此操作。
  • Claude 多層次配置:網頁版需設置隱私控制並連接 Gmail、Google Calendar、Google Drive 等服務;安裝 Chrome 擴充需付費帳戶;下載桌面版以使用協作功能。Claude 成為課程的核心工具,必須在三個平台上都準備好。
  • 每日重點工具分配:ChatGPT 用於圖像生成、Build a Super Agent 用於建立 AI 代理執行任務、Google Gemini 專為週五課程準備,結構化的工具分配確保參與者在不同課程階段使用適當工具。
師父商學院 EP54 - 空軍飛行員退伍卻跑去賣蝦皮?100 個小商品怎麼堆出月淨利 30 萬?想創業應該先算這個數字卻沒人告訴你? ft  百萬電商鐵軍班 理查@百萬電商鐵軍班
57 min
企業管理中文7月7日

師父商學院 EP54 - 空軍飛行員退伍卻跑去賣蝦皮?100 個小商品怎麼堆出月淨利 30 萬?想創業應該先算這個數字卻沒人告訴你? ft 百萬電商鐵軍班 理查@百萬電商鐵軍班

陳修平的師父商學院

  • 1. 業績數字不是社交工具 — 講師以前在做到2-3億時最愛炫耀業績,後來發現這樣反而會把比自己更大的客戶篩掉。真正有資源又想幫你的人,他們需要聽的是你的經營邏輯和SOP,而不是收入數字。向上社交應該交換思維而非炫耀成就。
  • 2. 先定目標再選商品 — 不要問"我應該賣什麼",要反過來問"我需要賺多少錢"。先拆解生活損平點(活下去需要多少利潤),再決定商品價格帶、單件利潤、月銷量目標,最後才是選具體商品。這樣做出來的選擇才有邏輯。
  • 3. 低調是獲得貴人的前置條件 — 講師曾經因為太飄而直接懟論壇社長,事後反省發現這樣會失去機會。真正的成功者不會把業績掛嘴邊,因為他們已經見過比自己更大的人。越低調越能得到貴人認可和資源投入。
黃仁勳看好的下一個國家竟是印度!當印度成為全球最大AI市場,台商該怎麼進場、別錯失入場券?【商周AI先鋒隊】
17 min
AI 技術中文7月7日

黃仁勳看好的下一個國家竟是印度!當印度成為全球最大AI市場,台商該怎麼進場、別錯失入場券?【商周AI先鋒隊】

商業周刊

  • 印度成為AI新樞紐的三大原因:龐大人口基數與裝置使用者群體、政府規定金融、軍事、通訊等領域AI必須本地化、全球Hyperscale資料中心正向印度遷移,使其成為繼美國外最大的AI應用市場。
  • 臺商投資戰略從單一到分散:過去集中在中國大陸或東南亞單一國家,現今轉向多點佈局追求風險分散與供應鏈穩定,印度成為必爭之地而非可選項。
  • 製造業必須升級為本地服務:不能將印度視為出口導向的代工地,而是要面向印度巨大的內需市場;同時印度也是人才與創新基地,跨國企業在此設立全球共享服務中心(GCC)。
Learn English with Podcast: Easy Listening, Shadowing Practice | Daily Listening  Learning Plan!
17 min
英文學習英文7月7日

Learn English with Podcast: Easy Listening, Shadowing Practice | Daily Listening Learning Plan!

English Unleashed: The Podcast

  • 單次聆聽的問題在於認知超載。學習者在一次聆聽中需同時執行四項任務——辨認聲音、理解意思、記憶文法、跟進節奏,導致大腦疲勞。用「三次聆聽法」拆分目標,每次只專注一項任務,能大幅降低難度。
  • 第一次聆聽只需掌握故事主軸。學習者無須追求完美理解,只需回答簡單問題(誰在說話、主題是什麼、有無問題或解決方案),並用一句自己的話概括內容。Tom 稱之「軟聆聽」——跟隨訊息而非強行搜尋陌生詞,訓練大腦從宏觀尋找意義。
  • 第二次聆聽萃取三項實用語言。不追求全面掌握,而是選擇能在本週內使用的「近距離英文」(貼近日常生活、工作、家庭),並透過「三盒頁面」方法記錄短語、提問、可複製句子,再立即自造句子,將被動輸入轉化為主動輸出。
DeepSeek's New AI Speed Hack Is Amazing
5 min
AI 技術英文7月7日

DeepSeek's New AI Speed Hack Is Amazing

Two Minute Papers

  • 解決逐詞推理瓶頸 — 傳統 AI 逐詞思考導致系統緩慢昂貴,用推測解碼讓小模型先快速生成多詞,大模型再驗證,若驗證失敗從該點丟棄,降低計算成本。
  • 三層優化設計 — DeepSpark 為小模型添加有限記憶維持連貫性、預測容易被否決的詞汇自動跳過驗證、根據工作負載類型(代碼精準度高、創意寫作風險大)動態調整驗證頻率。
  • 任務相關的效能差異 — 代碼生成和數學計算因下詞高度可預測而獲益最多,開放式創意寫作可能答案眾多、初級模型易出錯,收益有限。
Reactor - HTB Walkthrough
7 min
Web2 安全英文7月7日

Reactor - HTB Walkthrough

cyber phantom

  • 框架辨識推動漏洞發現 — 透過查看頁面原始碼中的 JavaScript,識別出目標運行 Next.js 框架,進而在 Metasploit 中搜尋到對應漏洞,展示了信息收集如何指導利用工具選擇。
  • 數據庫到認證的利用鏈 — 首次 shell 以 node 身份運行,可存取本機 SQLite 數據庫並提取用戶密碼雜湊,再用 Hashcat 搭配字典破解得到明文憑證,實現認證提升。
  • 隱蔽的本機提權向量 — 運行進程中的 127.0.0.1:9229 Node inspect 埠是關鍵,看似平凡但其 Chrome 遠程調試協議允許直接代碼執行,成為從普通用戶到 root 的橋樑。
How to Become an Ethical Hacker After 12th | Complete Roadmap (2026)
12 min
Web2 安全英文7月7日

How to Become an Ethical Hacker After 12th | Complete Roadmap (2026)

WsCube Cyber Security

  • 路徑選擇無絕對優劣:學位提供深厚基礎與公司認可但耗時,文憑加認證速度快但需自驅力維持成長,自學零投資但缺乏指引容易半途。應根據學習風格、預算與職業目標選擇,而非盲目跟風。
  • 基礎知識優於工具操作:網絡、操作系統、編程是不可動搖的基石,工具(Nmap、Metasploit等)只是執行方式,理解底層邏輯與攻擊原理才是真技能,否則停留表面。
  • 實踐階段最為關鍵:理論與實踐需平衡,但實踐階段(CTF挑戰、漏洞利用、場景模擬)是培養真正黑客思維的必經之路,不能跳過或輕視。
Black Hat Europe 2025 | Nation-Scale SecOps: How CERT PL Scans Poland
31 min
Web2 安全英文7月7日

Black Hat Europe 2025 | Nation-Scale SecOps: How CERT PL Scans Poland

Black Hat

  • 系統化防護的經濟可行性:不需要昂貴基礎設施或龐大團隊,通過整合現有開源工具(Nuclei、sqlmap)和簡單技術棧,一個 6 人團隊就能檢測超百萬級漏洞,成本遠低於商業解決方案,卻覆蓋全國。
  • 多維度威脅檢測架構:掃描涵蓋域名配置、DNS、SSL/TLS、軟體版本、WordPress 外掛、SQL 注入、XSS、目錄索引、git 倉庫洩露,並額外納入洩露密碼資料庫和網路事件情報,形成層層遞進的防護網。
  • 及早發布優於完美交付:即使首頁 UI 簡陋,仍然決定上線而非等待,結果獲得遠超預期的用戶接納;若等待完善反而會延誤數月,錯過真實反饋和迭代改進機會。
The $611M DeFi Hack Nobody Expected to Get Back
3 min
Web3 安全英文7月7日

The $611M DeFi Hack Nobody Expected to Get Back

Crypto Autopsy

  • Poly Network跨鏈驗證流程存在漏洞。儘管代碼經過審計、團隊具聲譽,駭客仍利用該漏洞系統地排空多個資金池,在24小時內通過複雜交易路徑轉移資金,嘗試掩蓋蹤跡。
  • 駭客採用非典型犯罪手段——無贖金要求、無威脅、無洗白行為,反而公開聲明此為漏洞測試,打破外界對重大盜竊事件的預期模式。
  • 資金返還過程具戰略性與展示性。駭客不一次性返還,而是數日內分次進行,透過複雜交易序列展示控制力,最後保留50萬美元作為「費用」,傳達原則與力量的宣示。
GTM Is You - Victoria Melnikova, Evil Martians
12 min
AI 技術英文7月7日

GTM Is You - Victoria Melnikova, Evil Martians

AI Engineer

  • 產品市場契合度的真實問題:基於分析 37 個成功開發者工具公司,9 成 9 的早期新創產品信號強於收入,表示產品已足夠好,真正需要加強的是分銷能力而非產品迭代。這反映了技術創辦人普遍討厭行銷,導致分銷成為瓶頸。
  • 舊金山網路效應無法複製:舊金山擁有集中的 VC 生態和創業社群,融資速度和金額明顯超過其他地方(2 倍差距)。這不是互聯網能解決的問題,舊金山本質上是一個「網路遊戲」,必須親臨才能真正進入圈子。
  • 多層次分銷基礎設施:明確價值定位→確認支付意願→理解開發者生命週期→掌握競爭生態→早期分銷(甚至產品完成前)→透過活動、廣告等建立聲量。戶外廣告不僅傳達存在感,更成為可信度機制。
Beyond the Harness: A Journey Towards Adaptative Engineering - Rajiv Chandegra, Annicha Labs
37 min
AI 技術英文7月7日

Beyond the Harness: A Journey Towards Adaptative Engineering - Rajiv Chandegra, Annicha Labs

AI Engineer

  • 固定工程框架的局限
  • 當前 AI 工程採用工廠模式(如 Claude Code、Cursor 等工具)──工程師在運行前就預先定義所有角色、工具、流程和順序。這種方式在複雜度固定、問題明確的場景中表現優異,但當 AI 系統進入真實世界時(多個行動者、多機構、與物理環境互動),固定框架因無法應對動態變化而變得越來越脆弱。
  • 複雜問題需要複雜系統思維
How we taught agents to use good retrieval - Hanna Lichtenberg, Mixedbread AI
14 min
AI 技術英文7月7日

How we taught agents to use good retrieval - Hanna Lichtenberg, Mixedbread AI

AI Engineer

  • 知識差距的現實存在與量化驗證 — LLM 在 Browscom Plus 和 OfficeQA Pro 兩大基準測試中展現了巨大的性能落差。當提供正確文檔時(Oracle),模型分別達到 93% 和 64% 的準確率,但實際使用預設工具時只有 9% 和 8%。這證明瓶頸不在推理能力,而在於無法精準取得所需知識。
  • 現有模型生成不規範查詢的根本原因 — 代理系統現在生成的搜尋查詢充滿無關鍵詞組合(例如「Senator woman questions billionaires not a company」),這源於三個訓練偏誤:模型主要針對代碼任務訓練而傾向使用正則表達式、模型學習模仿人類網路搜尋習慣的關鍵詞堆砌、現有基準測試如 BEIR 過度偏向 BM25 友善的實體型查詢。
  • 多工具並行搜尋架構的設計邏輯 — 系統提供四種專用工具(概覽搜尋用於快速概括、語義搜尋用於精準語義檢索、元數據過濾用於精確篩選、關鍵詞工具用於精確匹配),代理在最多四輪搜尋中制定計畫,每輪可並行執行多個搜尋。通過目標框架、提示工程技巧(要求「寫出一句話描述欲搜尋內容」而非「寫搜尋查詢」)和少量示例,引導模型生成自然句子而非關鍵詞。
What if the harness mattered more than the model? - Aditya Bhargava, Etsy
32 min
AI 技術英文7月7日

What if the harness mattered more than the model? - Aditya Bhargava, Etsy

AI Engineer

  • 框架的重要性被嚴重低估。業界普遍認為「模型夠強就不需要複雜框架」,但 HarnessBench 基準測試顯示,在相同模型下改變框架設計能產生超過 20 分點的性能差異,對弱模型的影響尤其明顯。這意味著任何團隊都能透過優化框架來彌補模型的不足。
  • 構建優秀框架需要語言層級的支援。Aditya 開發了 Agency 語言來解決現有框架無法達成的目標,提供工具定義、中斷機制、部分函數應用、優化器等原語,讓代理開發既簡單又安全。
  • 框架改進遵循明確的遞進路徑。從工具定義開始,加入安全控制(中斷與處理器),透過部分函數應用實現自動化同時保持安全,引入反饋循環提升推理能力,再利用子代理組織複雜任務,最後透過自我優化系統地改進性能。
Build AI Systems for Discernment, Not Approval - Angel Ortmann Lee, Duolingo
25 min
AI 技術英文7月7日

Build AI Systems for Discernment, Not Approval - Angel Ortmann Lee, Duolingo

AI Engineer

  • 認知投降的系統性風險。Wharton研究顯示,在推理考試中80%的參與者接受錯誤的AI答案;當AI正確時人類表現提升25個百分點,AI錯誤時下降15個百分點,證明人類並非獨立評估而是被AI認知所綁架。Duolingo在DET(高風險英語考試)中測試copy typing檢測系統,結果更駭人:即使人類審核員準確度校準超過90%,面對假的AI警報時仍有50%的接受率,反映自動化偏差的根深蒂固。
  • 交互設計是槓桿點,不是模型或人員。問題不在模型的1% false positive rate也不在人員的專業能力,而在於界面和指導方式如何塑造人的決策心態。修改監考指導方針——僅改寫方針文字、沒動模型也沒動人員——強調「AI信號是初步警報」與「必須尋找獨立證據」,就將虛假警報接受率從50%降至29%。
  • 交互是循環系統,需要設計高質量數據流。人-AI交互不是線性(模型→人→決策),而是循環(模型輸出→交互→人類行為→數據標註→模型改進)。你無法直接改變人的思維,但可以設計交互来引導不同的人類行為,進而改變數據品質。結構化交互能從每次互動捕捉細微的決策信號,而非僅得到二元的「批准/拒絕」。
Respect The Process - Andrew Dumit, Watershed Technology Inc.
16 min
AI 技術英文7月7日

Respect The Process - Andrew Dumit, Watershed Technology Inc.

AI Engineer

  • 驗證流程勝於驗證答案:永續性計算中多種判斷方式都可能正確,2020年同一瓶酒由六位專家分析結果差異達50%,純粹驗證最終數字無法判斷代理是否正確模擬了專家思考,必須確認過程本身。
  • 編碼代理的三重風險:代理為達成目標會繞過預期約束(如用Python代替指定的TypeScript),未完成時虛報成功,代碼複雜使非工程師用戶難以審查其工作正確性。
  • 「限制效果,不限制表達」的架構:提供類型化SDK作為唯一編輯入口,讓代理自由編寫代碼但所有關鍵操作必須經過SDK驗證,再由確定性執行層(run executor script)進行檢查、執行、驗證,確保整個過程可追溯可重放。