KeyFrame內部研究專用
每日

今日 KeyFrame

管線分析的每一部影片,最新的優先。每張卡片都直接連回原始影片。

8月20日星期四

3
文組也能上手 AI Agent!ChatGPT Work 讓你的生產力翻倍!
16 min
AI 技術中文8月20日

文組也能上手 AI Agent!ChatGPT Work 讓你的生產力翻倍!

漢克蔡 | Ai 集

  • AI代理的核心價值在於自動化三類反覆性工作:整理資訊(會議紀錄、報表)、自我學習(文章總結)、機會發掘(求職、商機研究)。透過開啟外掛(Gmail、Google Drive、瀏覽器)連接資料來源,使用者只需上傳樣板或範例圖片,AI就能依照既定格式自動產出完整文檔,省去重複的格式調整時間。
  • 設定手機遠端遙控功能後,使用者可在通勤時用語音指令下達工作任務,讓AI在電腦上持續運作,徹底分離「人工作時間」與「AI工作時間」,大幅提升單位時間的產出效率。建置可重複使用的自訂Skill工作流程,使得複雜任務(如Lead Research)可標準化、批次化執行,進一步降低每次重新配置的成本。
Your Fine-Tuned Model Is Tech Debt: A 50x ROI House of Cards — Dan Bjornn, Lease End
16 min
AI 技術中文8月20日

Your Fine-Tuned Model Is Tech Debt: A 50x ROI House of Cards — Dan Bjornn, Lease End

AI Engineer

  • RAG 方法的限制:早期使用工作流式 RAG 系統,雖然搜尋客戶訊息和相關職位,但無法有效處理複雜對話情境,經常出現邏輯錯誤(如誤觸發電話)。
  • 微調的隱形成本:微調看似能解決問題,實則帶來「結晶化稅」—每修改一個問題就會引發其他連鎖問題,需要持續重新訓練,流程耗時一週且高度複雜。
  • 技能與上下文才是關鍵:受 Claude Code 啟發,發現改用模型不可知的技能架構搭配系統提示,只需調整提示詞而非重新訓練,在保持靈活性的同時大幅提升準確度。
The robots have gone bananas.
31 min
Web2 安全英文PODCAST8月20日

The robots have gone bananas.

CyberWire Daily

  • AI 降低攻擊門檻:聯邦機構警告指出,駭客利用 AI 生成 exploit 腳本加快漏洞發現與適應防禦措施的速度,使用者缺乏足夠監控能力。工控系統因第三方廠商未知的連線暴露,風險更高。
  • 供應鏈漏洞的級聯效應:Citrix 的兩個漏洞、Stripe 的 50,000 個洩露 API 金鑰、以及 Atlassian/Splunk/Cisco 的數百個漏洞,均展示單一弱點可導致大規模風險,組織需要優先修補機制。
  • 社交工程與多層次惡意軟體:針對 Black Hat/DEF CON 的攻擊使用偽造 Google Doc 與 Google Apps Script 進行偵察,佐以特定平台的隱形覆蓋層與多功能 RAT,显示駭客精心設計的戰術。

8月19日星期三

7
Risky Bulletin: Slovakia finds Russian backdoors on its speed cameras
7 min
Web2 安全英文PODCAST8月19日

Risky Bulletin: Slovakia finds Russian backdoors on its speed cameras

Risky Business

  • 國家級駭客活動升級:伊朗駭客(MAVNA研究所/Cobalt Dickens)針對以色列記者、全球大學進行有組織的間諜活動,美國司法部提起17人起訴、懸賞1000萬美元,顯示大國網路對抗的激化。
  • 供應鏈與硬體後門成為新威脅:斯洛伐克購入270多台俄羅斯速度攝像頭(含後門)、14,500台大華監控攝像頭遭駭,說明硬體採購驗證與初始存取控制的重要性。
  • 執法機構利用公開漏洞實現突襲:法國警方透過2020年發佈在Github的BadBinder漏洞成功駭入EncroChat,證明已知漏洞仍具威脅性。
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Bounty Hacker TryHackMe Walkthrough | Full Room Guide
9 min
Web2 安全英文8月19日

Bounty Hacker TryHackMe Walkthrough | Full Room Guide

Cyb3rak

  • 連接埠掃描是滲透測試的基礎 — Nmap 可透過版本掃描和腳本掃描不僅找到開放連接埠,還能識別服務版本與安全配置缺陷,例如匿名 FTP 登入權限。
  • 多層資訊收集建立攻擊鏈 — 從 FTP 伺服器的文字檔案中提取密碼清單,識別目標使用者名稱(lin),為後續的 SSH 暴力破解提供必要的輸入。
  • 工具鏈整合完成自動化攻擊 — Hydra 工具結合用戶名與密碼清單對 SSH 進行批量暴力破解,大幅降低手動測試的複雜度,快速獲得有效憑證。
Black Hat Asia 2026 | When Office Attacks: XLL Chains and Enterprise EDR Nightmares
38 min
Web2 安全英文8月19日

Black Hat Asia 2026 | When Office Attacks: XLL Chains and Enterprise EDR Nightmares

Black Hat

  • XLL 比宏更難檢測:XLL 是重命名的 DLL 檔,執行原生程式碼而非解釋腳本,防守方看不到原始碼,同時 Excel 會自動載入並執行(無需使用者警告),這完全繞過了傳統宏防禦。
  • EDR 信任等級制度被濫用:EDR 對微軟簽名的二進位檔(Word、Excel)信任度高,攻擊者利用此點,確保有效載荷只在信任的辦公進程內執行,從不接觸低信譽的二進位檔或 PowerShell,看起來完全合法。
  • 現代 EDR 的檢測缺陷:許多組織出於隱私、合規或成本考量關閉 EDR 雲端功能,導致本地機器學習能力大幅下降;即使啟用遙測,高誤報率迫使安全團隊削弱檢測規則,形成自我強化的盲點循環。
信仰的反噬,Dario和他背后的女人 | Anthropic | Cami Clark | 爱泼斯坦 | 埃里克施密特 | AGI | OpenAI | 硅谷 | IPO | AI治理
19 min
企業管理中文8月19日

信仰的反噬,Dario和他背后的女人 | Anthropic | Cami Clark | 爱泼斯坦 | 埃里克施密特 | AGI | OpenAI | 硅谷 | IPO | AI治理

Best Partners TV

  • 文化與規模的衝突:Anthropic 初期圍繞 AI 安全建立統一信仰,透過准宗教色彩的全員會議維繫凝聚力。但快速擴張至數千員工後,新人不認同、老人價值觀動搖,員工被迫在股權與精神壓力間二擇一,內部甚至出現匿名吐槽渠道。
  • 道德立場與商業現實的矛盾:公司一邊宣稱要控制 AI 風險,一邊急著訓練更強模型搶佔市場;曾在模型中加入暗示機制防止他人研究引發軒然大波;與特朗普政府因武器與監控紅線衝突,卻在水印、融資等決策上持續讓步。
  • 隱形權力網絡:CEO 妻子 Kami Clark 雖無正式職位,卻實際掌管安保、公眾形象、家族投資、項目篩選,甚至與艾凡卡·特朗普建立友誼,成為達里奧進不去的權力房間的通道,形成利益衝突邊界不清的局面。
The AI New Cold War Begins! U.S. Demands Allies Pick a Side; China's July Loans Hit Record Low as...
34 min
企業管理中文8月19日

The AI New Cold War Begins! U.S. Demands Allies Pick a Side; China's July Loans Hit Record Low as...

新聞大破解隨選

  • AI成為外交戰場的二選一
  • 美國明確要求盟友選邊站,視安全考量為最高優先次序。美國國務院發信給數十個簽署過AI機遇聲明的國家,強調「樣樣都參與就等於什麼都沒有真正參與」,意指無法同時加入北京與華盛頓的競爭框架。這打破了冷戰後全球化時期的模糊空間,進入明確的系統對抗。
  • 供應鏈認證體系成為新防禦機制
Hackers hiding in plain sight.
28 min
Web2 安全英文PODCAST8月19日

Hackers hiding in plain sight.

CyberWire Daily

  • 勒索軟體與進階持續性威脅的規模擴大:Medusa從2025年的300個受害者成長至超過500個,反映勒索軟體即服務(RaaS)模式的持續演化;伊朗駭客透過MABNA機構自2013年起系統性竊取學術機構與政府機構數據,每次入侵都造成美國大學數百萬美元的調查與修復成本。
  • 漏洞利用與供應鏈風險:攻擊者正針對廣泛使用的企業軟體漏洞(如PTC WindChill),一次漏洞往往能入侵數十家企業客戶,且企業通常要數月才能發現;惡意軟體逐漸演變為多層次隱蔽技術,如TwinLoot利用合法Microsoft服務作為命令控制通道。
  • AI代理的安全矛盾:企業要讓AI代理發揮價值必須連接企業數據,但目前僅3%企業數據已連接AI系統;AI代理具自主性與非確定性,能跨系統操作與做出決策,比單純資訊檢索工具風險更高;安全防護需在不過度限制代理功能與防止數據洩露間求平衡。

8月18日星期二

20
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性
Discovery Loop的愿景 | Jeff Dean | MoE | TensorFlow | 深度学习 | AI Agent | 递归式自我改进 | 科研自动化 | AI下个十年的方向
16 min
AI 技術中文8月18日

Discovery Loop的愿景 | Jeff Dean | MoE | TensorFlow | 深度学习 | AI Agent | 递归式自我改进 | 科研自动化 | AI下个十年的方向

Best Partners TV

  • MoE是容量與效率的突破性平衡——通過稀疏激活(只啟動必要的專家)實現大容量模型的低成本推理,類似人腦在不同任務激活不同區域,十倍效率提升代表了技術路線的根本轉變,而非普通優化。
  • 開源框架的成功來自核心簡潔——TensorFlow普及深度學習的同時留下設計代價,靜態計算圖對部署有利但研究者不自然,contrib目錄的開放善意反而造成混亂;正確做法是保持核心穩定,讓實驗功能建立在上層。
  • 研究直覺來自系統性的廣泛監測——不深耕單篇論文,而快速瀏覽百篇摘要理解領域全貌;通過第一原理和快速估算判斷技術可行性,這種能力來自持續練習而非天賦,讓你在複雜問題中發現已有的解決方向。
課程搶先看:領導與管理的差異【陳宗賢的主管升級策略學】
14 min
企業管理中文8月18日

課程搶先看:領導與管理的差異【陳宗賢的主管升級策略學】

Hahow 好學校

  • 領導與管理的根本區分:領導針對人,透過信任與認同激發團隊凝聚力;管理針對事,透過要求與控制創造績效價值。一個領導者的成功標誌是團隊是否認同你、是否願意與你同心協力。
  • 創價的具體定義因部門而異:業務單位是市場開拓與業績創造、應收帳款回收;生產單位是效率提升、耗損降低、品質與產能提升;行政是時間掌控與成本降低;研發是開發能賣出去的商品或引進有幫助的服務。
  • 管理方式的實際效果差異:優秀領導帶來低異動率、低請假率、高執行力;只重視管理則造成組織鬆散、人心渙散、最終孤家寡人;只講領導不要求績效則變成「爛好人」,團隊停滯無成果。
1個人+AI,就能做成一家公司?2026普通人最值得搶先理解的OPC賽道:一人公司、AI智能體、創業紅利、變現渠道一次講透。小白也能抓住的新機會!
5 min
企業管理中文8月18日

1個人+AI,就能做成一家公司?2026普通人最值得搶先理解的OPC賽道:一人公司、AI智能體、創業紅利、變現渠道一次講透。小白也能抓住的新機會!

阿温Awen

  • OPC 的結構性變革:傳統個體戶與 OPC 本質不同,前者一人多職,後者是人腦決策+AI 團隊執行,實現真正的一個人公司。
  • 政策紅利階段:超過 20 個城市出台專項扶持政策,深圳計畫打造 11 家 OPC 社區,上海浦東最高補貼 30 萬,海南直接獎勵最高 800 萬,都是真金白銀投入。
  • 市場增長數據:OPC 收入比傳統工作者高 62%,市場不是溫和增長而是結構性擴張,到 2026-2028 年間預計誕生首家估值超 10 億美元的 OPC。
讲透8大AI核心概念:看清大模型从“会说话”到“能办事”的演进脉络
14 min
AI 技術中文8月18日

讲透8大AI核心概念:看清大模型从“会说话”到“能办事”的演进脉络

白白说大模型

  • LLM 本質是基於統計概率的文字生成器,而非知識庫檢索系統。它透過學習訓練數據的規律來逐字預測下一個詞,而非從資料庫查找現成答案;這解釋了它有時會信口開河的原因——目標是生成最通順的文字,不是提供客觀事實。
  • Token 是理解 AI 成本的關鍵密碼。中文的 Token 消耗量通常是英文的 1.5~2 倍,因此將中文背景描述翻譯成英文寫入系統提示詞,不僅能提升理解效率,還能直接省下一半的賬單費用。
  • Context(上下文)是臨時黑板而非長期記憶。每次提問時系統會重新打包所有歷史對話放在這塊黑板上,但容量有限,超出時最早的內容被自動清除,因此塞進去的信息質量和準確度直接決定了 AI 的輸出品質。
deepseek harness AI编程十大插件推荐
8 min
AI 技術中文8月18日

deepseek harness AI编程十大插件推荐

AI随风

  • 基礎工具類插件提升核心效率。DubStack Market 提供統一安裝入口;側邊欄插件整合文件瀏覽、終端、任務管理;預算插件讓用戶精確追蹤 token 消耗;消費限制插件可設定每日上限(達 80% 警告、100% 停止),解決 API 費用失控的問題。
  • 功能擴展插件依賴現有資源。視覺識別插件需先配置本地 Claude API 或其他模型的 API key,才能路由至相應服務;安裝時會自動檢測本地環境,提示是否使用已配置的模型。
  • 多工具同步提高工作流靈活性。對話導入插件支持從其他 AI 工具(如 Gemini)導入對話記錄,同時支持雙向同步,用戶可在不同工具間無縫切換而不丟失上下文。
Between Two Nerds: The eye of Sauron
32 min
Web2 安全英文PODCAST8月18日

Between Two Nerds: The eye of Sauron

Risky Business

  • 防禦者掌控「地形」優勢:防禦方擁有對網路的完全認知與控制權,可以任意重新配置、分段、修補、替換或臨時關閉系統,這是攻擊者無法擁有的非對稱優勢。
  • 適用於特定威脅型態:該策略針對需要長期駐留(dwell time)的國家級情報蒐集型威脅,不適用於勒索軟體或快速掠奪型攻擊,因為高級別任務會因為謹慎而抗拒觸碰可疑新增系統。
  • 環境改變產生真實成本:主動改變網路會中斷用戶、消耗 IT 人力資源、與業務營運產生衝突,因此只有成熟且了解威脅現實的組織(特別是政府機構)才有動機執行。
SANS Stormcast Tuesday, August 18th, 2026: Apple Patches; Screen Sharing Security; Download More RAM
9 min
Web2 安全英文PODCAST8月18日

SANS Stormcast Tuesday, August 18th, 2026: Apple Patches; Screen Sharing Security; Download More RAM

SANS Stormcast

  • Apple本次補丁發布主要針對舊系統,iOS 18占87個漏洞,顯示這次更新帶有補足舊版本的性質;大多數漏洞為WebKit相關,安全等級不算嚴重,但螢幕共享漏洞已在實際環境被利用。macOS螢幕共享基於VNC協定實現,支援系統級密碼存取,同時防火牆預設對系統程序開放,單純啟用防火牆無法完全保護,需額外停用系統程序的螢幕共享存取權限。Windows記憶體漏洞利用EPROM可軟體寫入的特性,通過超頻軟體訪問I2C匯流排,將實體記憶體容量翻倍,導致系統記憶體存取控制機制失效。
English Speaking Practice Shadowing | Everyday English Dialogues with Listen and Answer 🎧
20 min
英文學習英文8月18日

English Speaking Practice Shadowing | Everyday English Dialogues with Listen and Answer 🎧

ABC Learning English

  • 妥協與折衷的真義在於雙方都做出讓步,而非單方面的遷就,才能找到真正的共同方案。適應力強意味著隨時準備好快速改變計劃,面對突發狀況時能靈活應變,這樣的團隊合作往往帶來豐厚回報。養寵物前需充分了解其習性與需求——孔雀魚等熱帶魚需要溫暖環境和足夠空間,不能隨意飼養。賦予舊物新用途、給予第二次機會是一件美好的事,能喚起美好回憶並創造新的價值。
English Podcast For Learning English Conversation | Talk About Dreams and Goals | English Listening
27 min
英文學習英文8月18日

English Podcast For Learning English Conversation | Talk About Dreams and Goals | English Listening

Speak English With Class

  • 夢想和目標是兩回事。夢想是方向與願景,提供內心拉動力;目標是具體可執行的行動計畫。「寫一本書」是夢想,「每週寫三次、每次500字」才是目標。沒有目標的夢想只是舒適的幻想,永遠停在「有一天」。
  • 追求的往往是結果,不是過程。講者親身經驗——曾想要某份工作是因為職位名稱、公司背景和他人的反應,而非工作內容本身。與真正從事者聊天後才發現,大部分時間是枯燥任務,自己感興趣的工作卻很少。關鍵問題是:沒人知道你成功時,你還想要嗎?
  • 起步要小,別用「充分準備」當藉口。講者花時間研究相機、軟體、課程,準備本身成了嗜好。朋友建議直接用手機拍7天,這個簡單建議改變了一切。完成挑戰後才明白,障礙不是設備缺乏,而是對完美的追求。
Cloudflare built a browser for AI agents in Rust
7 min
AI 技術英文8月18日

Cloudflare built a browser for AI agents in Rust

Let's Get Rusty

  • 解決的真實問題:AI 代理需要瀏覽器執行任務,但 Chromium 為人類設計,帶來 AI 模型不需要的記憶體與計算開銷,導致每個代理實例成本高昂。Cloudflare 決定針對 AI 代理需求開發專用瀏覽器。
  • AI 代理的真正需求:代理不需要標籤頁、主題或擴充功能,反而更在乎令牌數量、上下文視窗、可擴展性與效能。代理優先需求結構化機器可讀內容,威脅模型涉及提示注入與工具安全,這些都與人類瀏覽器的設計理念完全不同。
  • 工程方法的嚴謹性:增加大量測試(Web 平台測試套件、Puppeteer 多步驟測試),盡可能使用 Rust 編譯為 WebAssembly 避免模擬層,採用無狀態組件設計,所有網路請求經過單一沙箱出站組件檢查。
7 Useful AI Tools That Are Actually FREE! 2026
9 min
AI 技術英文8月18日

7 Useful AI Tools That Are Actually FREE! 2026

Brett In Tech

  • 學術研究工具的民主化:Semantic Scholar提供完全免費的學術論文搜尋和分析功能,支援TLDR摘要、引文指標、閱讀庫建立等進階功能,讓許多付費AI工具都以其為骨幹。
  • 內容創作的語音合成方案:Speechify和Speech Mock都提供完全免費的文字轉語音服務,支援多語言和口音選擇,且可用於YouTube、TikTok等獲利內容,打破創作者對配音員的依賴。
  • 生成式AI工具的整合生態:Dreamina和Leonardo.Ai都提供免費額度的圖像生成,並支援多種AI模型選擇,包括Google Gemini、ChatGPT等,讓使用者有彈性的創作工具組合。
30 Self-Hosted Projects on GitHub: wacrm, halcyon-video, wrtag, Codeman, romm, wger, homelab, clay
12 min
GitHub 熱點英文8月18日

30 Self-Hosted Projects on GitHub: wacrm, halcyon-video, wrtag, Codeman, romm, wger, homelab, clay

GitHub Awesome

  • 數據主權與隱私核心:這些專案的共同特點是數據完全在使用者控制下,不依賴訂閱制或廠商,例如 WACRM 使用 Meta 官方 API 避免帳號停用,OpenArchiver 以 EML 標準格式本地儲存郵件,HQBase 在使用者自有 Cloudflare 帳戶內運行。
  • 現代技術棧達企業級質量:這些自架方案採用 Kubernetes、PostgreSQL、Cloudflare Workers 等企業級技術,證明開源不等於簡陋,Eden 家庭實驗室的完整配置就是最好例證。
  • 跨領域替代完整性:從業務通訊(WACRM、LibreDesk、HQBase)到多媒體(Halcyon、ROMM、Viofo Sync)、生產力(Super Productivity、Clay、Note Discovery)、財務(Tilevia、Taxhacker、Expenseive),開源生態已能覆蓋 SaaS 的主要應用場景。
I Asked 6 CEO On Their AI Workflow: Best Tools, Agents, Skills (copy them now)
22 min
AI 技術英文8月18日

I Asked 6 CEO On Their AI Workflow: Best Tools, Agents, Skills (copy them now)

Silicon Valley Girl

  • 系統集成勝於單點應用 — Luana Lopez(Kalshee 創始人,估值超過 10 億美元)將 AI 代理連接到郵件、文檔、Slack 等所有系統。她每週日原本要花整天時間整理公司狀態,現在 AI 自動化完成,讓她能邊吃早午餐邊審視數據。系統並能追蹤過度承諾、交付不足的員工模式,支持更好的人事決策。
  • 個人化記憶和決策框架是必需品 — Eric(史丹佛數位經濟實驗室)強調 AI 價值深度融入生活時最高,他估計一個月不用 AI 損失「數萬美元」。他建議新手先問 AI「你如何能幫助我」,讓 AI 進行訪談式對話找出 10 項使用場景。Aaron Levy(Box CEO)則強調上傳品牌語調、商業策略、個人目標、決策規則等文檔,讓 AI 輸出聽起來像自己。
  • AI 執行 90%,人類做最後 10% — Peter Yang(前 Meta/Reddit/Roblox)構建了播客製作、電子報編輯、社交媒體發佈、顧問建議等自動化技能。但所有決策、郵件發送、社交發佈都必須人類先審核。Sal Khan(Khan Academy)同樣強調讓 AI 草擬郵件,但不讓它直接發送。
4 个每周能帮你省下好几个小时的 AI 工具
5 min
AI 技術中文8月18日

4 个每周能帮你省下好几个小时的 AI 工具

AI工具箱

  • 郵件管理的痛點不在寫信,而在資訊檢索。Shortwave 透過自然語言查詢取代逐封檢視,減少判斷和尋找信息的時間成本。
  • 計畫總是在變,手動調整很耗時。Reclaim 的價值在於自動處理日程衝突和任務重排,讓你只需輸入「要完成什麼」,而不必手動找時間槽。
  • PPT 最耗時的是內容整理,不是排版。Gamma 提供可編輯的初稿版本,讓你從改進而非從零開始,這個加速效果非常顯著。
Generative Video at the Speed of Light — Keegan McCallum, uRun
8 min
AI 技術中文8月18日

Generative Video at the Speed of Light — Keegan McCallum, uRun

AI Engineer

  • 效率革新驅動成本崩落:與去年邊界模型相當的品質,現在產生速度快且成本下降百倍,使實時影片生成從原型階段進入可商用階段。
  • 模型多元化與組件化發展:世界模型、虛擬形象模型、影片轉影片模型等至少 40 個新模型涌現,各具特化能力,需要的是組合與編排而非單一超大模型。
  • 低延遲互動成為新的交互範式:使用者能在生成過程中即時操控攝影機視角和內容方向(響應時間不到一秒),改變了過去「試驗一次 10 美元」的插槽機制式體驗。
Infra behind Krea 2: How to train and serve at scale — Gabriel Jorge Menezes, Krea.ai
16 min
AI 技術中文8月18日

Infra behind Krea 2: How to train and serve at scale — Gabriel Jorge Menezes, Krea.ai

AI Engineer

  • 監測是基礎設施的基石 — 大規模訓練容易出現不明崩潰(8 小時以內),無法診斷原因。投資完善的監測系統讓研究員能掌握系統狀態,決定何時移除故障 GPU 或調查跨節點通訊問題。
  • GPU 利用率指標是誤導的 — 官方的 GPU 利用率顯示 100% 不代表 GPU 在做有效工作。Tensor Core 利用率才能反映真實工作效率,且隨著影像解析度擴展而動態變化。
  • Infinite Band 監測是必需的 — 訓練過程中大量跨節點通訊,Infinite Band 監測能捕捉訊息延遲、封包遺失與通訊錯誤,往往是訓練失敗的根本原因。
Voice agents with Realtime Video — Sidney Primas, LemonSlice
26 min
AI 技術中文8月18日

Voice agents with Realtime Video — Sidney Primas, LemonSlice

AI Engineer

  • 世界模型策略優於傳統做法:雖然訓練難度初期較高,但模型一旦完成,全身動作、物體互動、微表情等複雜特性能自然涌現,無須逐一編程,大幅降低後期工程成本。
  • 實時互動的雙重技術突破:訓練單向注意力遮罩使模型只看過去(無法預知未來輸入),再將生成步驟從30步壓縮到1步,才能在對話中達成即時反應。
  • 錯誤累積是長時間生成的核心挑戰:每幀生成都包含微小誤差,這些誤差在後續幀生成時被參考並放大,使長程生成品質衰減;LemonSlice開發全新解決方案讓虛擬頭像可連續運行16小時無明顯劣化。
While my guitar gently speaks — Todd Fisher, Philo Ventures
18 min
AI 技術中文8月18日

While my guitar gently speaks — Todd Fisher, Philo Ventures

AI Engineer

  • 設計循序漸進 — 先解決文字轉語音,再處理詞語分段挑戰(能量間隔分析與音頻峰值辨識),最後才進階到音高檢測與合成音符,每一步都建立在前一步的基礎上。
  • 音高檢測是關鍵 — 用 YIN 音高演算法偵測吉他彈奏的音高,轉換成合成音符,再通過聲碼器混合 AI 語音,這樣才能讓吉他真正「開口說話」。
  • 工程與創意的平衡 — 無法完全自動化的部分(例如詞語分段不完美時)就手動調整,實用化優於完美化,快速迭代才能推進專案。
The Next Game Engine Won't Have a Manual — Arturo Nunez, Nereu
19 min
GitHub 熱點中文8月18日

The Next Game Engine Won't Have a Manual — Arturo Nunez, Nereu

AI Engineer

  • 現有遊戲引擎要求開發者掌握程式設計、建模、渲染、動畫等多個領域,導致高學習曲線與冗長開發週期;Nereu 改用自然語言描述,讓使用者聚焦遊戲設計本身而非技術細節。
  • 系統採用實體-組件系統架構,每個遊戲物體只需加上描述用途的標籤(如「角色」「可動畫」「雙段跳」),引擎內的系統會自動查詢並執行相應邏輯,避免重複編寫樣板程式碼。
  • AI 助手 BB 透過場景上下文、使用者編輯位置和遊戲類型資訊,理解使用者意圖並自動新增或移除標籤;使用者隨時可提問如何實現特定功能,大幅降低認知負荷。