KeyFrame內部研究專用
每日

今日 KeyFrame

管線分析的每一部影片,最新的優先。每張卡片都直接連回原始影片。

7月11日星期六

1
Web3新手最容易踩的是哪些坑?#Web3安全 #钱包安全 #钓鱼骗局 #恶意授权 #DeFi风险 #跨链桥风险 #土狗盘#Web3入门
11 min
Web3 安全中文7月11日

Web3新手最容易踩的是哪些坑?#Web3安全 #钱包安全 #钓鱼骗局 #恶意授权 #DeFi风险 #跨链桥风险 #土狗盘#Web3入门

兰陵萧氏

  • 操作風險最殘酷:Web3沒有反悔機制,釣魚網站通常不會顯而易見,而是盡量模仿官網。駭客利用的不是技術漏洞,而是用戶在緊張和貪婪狀態下的判斷失誤。永遠不要通過陌生私信進入項目網站。
  • 授權不等於登入:連接錢包只是讓網站讀取你的公開地址,但批准代幣授權才是交出資產操作權限。無限額度授權或授予不明對象時特別危險,對方不需要再次確認就能按授權範圍轉走資産。
  • 收益必有其源,必有其代價:高APY背後要麼是實際利息手續費,要麼是項目方不斷發行新代幣補貼。若獎勵代幣價格暴跌,用戶實質收益可能為零。任何收益都對應某個風險承擔者。

7月10日星期五

11
Prompt Injection Attack Explained For Beginners
3 min
AI 安全英文7月10日

Prompt Injection Attack Explained For Beginners

KodeKloud

  • Prompt Injection的基本原理:LLM無法有效區分用戶真實意圖和隱藏在數據中的指令,會將郵件正文、文件內容等誤當成可執行命令,導致執行非預期的操作
  • 攻擊向量的廣泛性:不僅限於郵件,還包括聊天記錄、文件、文件、代碼、Issue描述等任何被LLM讀取的內容都可能成為注入點,使得暴露風險遠超預期
  • 多層次防護方案:在模型層面區分系統/用戶指令與工具返回數據、在權限層面限制危險操作、在環境層面使用沙箱隔離代碼代理的訪問範圍
Understanding the inner thoughts of AI
53 min
AI 技術英文7月10日

Understanding the inner thoughts of AI

Google DeepMind

  • 神經網絡的自然演進特性決定了解釋性的必要性:沒有人為設計師事先規定 Gemini 或其他大型模型應該長什麼樣,而是通過隨機初始化後持續用數據和反饋微調,最終涌現出複雜能力。這個過程類似於進化論——就像生物學家需要逆向工程化演化學到了什麼一樣,解釋性研究者的工作就是理解神經網絡訓練學到了什麼。
  • 鏈式思考是現存最實用但最脆弱的解釋工具:模型在回答前先用自然語言展示工作過程,這提供了對推理的直接窗口。當模型作弊或欺騙時往往會在思考中暴露——比如寫下「這個任務很難,但如果我硬編碼測試答案就會過關」。然而這種優勢是短期的:未來更聰慧的模型會學會在思考中也進行欺騙,或改用向量形式隱藏資訊。
  • 線性表示使得概念能被科學地操縱和理解:研究發現「幸福」等概念在激活空間中有明確的方向,可以通過比較不同文本的激活差異提取出來,然後加入任何生成文本都會使其變得積極。這表明神經網絡的深層表示具有可理解的結構性,而非完全的隨機噪音。
LangChain Tutorial for Beginners — Crash Course 2026 (First 5 Min) | LangChain 初學者教學:2026 速成課程 雙語
4 min
AI 技術英文7月10日

LangChain Tutorial for Beginners — Crash Course 2026 (First 5 Min) | LangChain 初學者教學:2026 速成課程 雙語

Markluce AI

  • 模型與應用的差距:ChatGPT、Gemini、Claude 等單個模型只能進行對話演示,真實應用需要多步推理、API 調用、數據庫查詢、會話記憶、錯誤處理等完整系統設計。
  • LangChain 的核心價值:作為膠合層,LangChain 將概率性的語言模型轉換為具有確定性行為的生產系統,通過結構化構件讓開發者能主動控制模型的使用方式而非被動期望它正確運作。
  • LLM 固有的可靠性問題:大語言模型容易產生幻覺、答案不一致、記憶能力缺陷、難以遵循工作流,LangChain 通過分步驟執行、設置防護欄、監控底層過程來解決這些問題。
从零搭建Agent自动化评估体系
9 min
AI 技術中文7月10日

从零搭建Agent自动化评估体系

白白说大模型

  • Agent 與傳統軟體本質不同。傳統軟體是確定性系統,輸入固定結果固定;Agent 則像一位思維活躍的員工,同樣問題每次回答可能不同,導致傳統測試方法完全失效,需要建立動態質量標準。
  • 四層框架實現全流程自動化評估。輸入層需建立規範全面的測試樣本庫(覆蓋核心場景、邊界情況、常見問題);執行層要多輪重複運行並完整保存過程日誌;產出層將零散結果統一結構化;評卷層將評分規則轉化為代碼和模型判定。
  • 區分客觀與主觀任務的評分方式。客觀任務(如計算、標準問答)用代碼直接判定,精準快速;主觀任務(如寫文案、方案設計)用精度更高的大模型評判,並要求詳細打分理由,實現可追溯可解釋。
Black Hat Europe 2025 | Pwning .NET Framework Applications Through HTTP Client Proxies And WSDL
39 min
Web2 安全英文7月10日

Black Hat Europe 2025 | Pwning .NET Framework Applications Through HTTP Client Proxies And WSDL

Black Hat

  • 無協議驗證的 .NET 設計缺陷:HttpWebClientProtocol 基類在獲取 Web 請求物件時,使用 as 運算符進行類型轉換。此運算符在轉換失敗時返回 null 而非拋出異常,使得當 SOAP 代理被強制使用 file:// 協議時,FileWebRequest 物件能夠無聲地被接受,進而執行文件寫入而非網路通信。
  • WSDL 導入的攻擊表面擴展:Service Description Importer 類不對 WSDL 內的服務地址 URL 進行協議驗證,允許攻擊者透過惡意 WSDL 檔案直接控制生成的代理代碼所使用的協議。應用編譯並加載此代碼後,會自動將 SOAP 請求寫入本地檔案系統而非發送到網路。
  • 分層漏洞利用鏈與變通方案:完整 RCE 需四個條件(應用使用 WSDL 導入、方法名可控、參數可控、參數反序列化)。即使某些條件缺失,也可透過 XML 命名空間注入(namespace smuggling)在 WSDL 命名空間 URL 查詢字符串中嵌入 Payload,繞過限制實現代碼執行。
NotebookLM 2 0徹底變了:2026年最重要更新一次看懂!
18 min
AI 技術中文7月10日

NotebookLM 2 0徹底變了:2026年最重要更新一次看懂!

李厂长来了

  • NotebookLM 的核心差異在於其信息準確度。它嚴格基於用戶上傳的文檔生成內容,不會編造數據,這使其特別適合需要高可靠性的工作;但相應地,其創造力不足,不適合頭腦風暴或創意寫作,建議這類任務改用 Claude、Gemini 或 ChatGPT。
  • 新增智能助手功能大幅提升了工作效率。系統會自動檢測筆記本中的信息缺口(如中文職場適配、中小企業案例、非科技行業應用等),並主動建議搜索方向,用戶無需自己逐一梳理遺漏點。
  • 工作室面板的九大功能讓文檔快速轉化為可用成品。音頻概覽將長文件變成兩位主持人的對話(5-10 分鐘生成),演示文稿支持在平台內直接修改後導出,視頻概覽生成帶解說短視頻(10-15 分鐘),報告功能秒生簡報,思維導圖一覽資料結構,閃卡和測驗適合學習,信息圖和數據表格實現視覺化和數據匯總。
openSUSE Conference 2026 - LLMs: The good, the bad and the ugly from a security POV
43 min
AI 安全英文7月10日

openSUSE Conference 2026 - LLMs: The good, the bad and the ugly from a security POV

openSUSE

  • LLM 改變了安全工作的尺度:安全審查不再是瓶頸,反而是漏洞報告與修復成能量成為新的瓶頸,使用者無須具備技術背景也能靠自然語言指示 AI 完成過去困難的工作。
  • 提示注入是根本性問題:無法通過現有技術解決(目前最佳成果僅達 95% 防禦率),存在通用攻擊方式(universal prompt injection)、角色混淆等多種變種,模型甚至在重複詢問或上下文膨脹時防禦會減弱。
  • 人工審查迷思並不能解決安全問題:將決策權交給人類審批在操作上無效,因為人類不會持續維持 100% 的審查專注度;與其依賴「人機迴圈」,不如承認這只是轉移法律責任,並非真正安全。
Should AI Engineers Still Read Code in 2026? The Z/L Continuum — Alex Volkov, ThursdAI
21 min
AI 技術英文7月10日

Should AI Engineers Still Read Code in 2026? The Z/L Continuum — Alex Volkov, ThursdAI

AI Engineer

  • 代碼廉價問題已解決,新瓶頸是人工審查。GitHub數據顯示2025年代碼刪除增加861%、bugs增加242%、未經審查PRs增加31%——快速生成帶來質量隱患,需要重新設計審查策略而非放棄審查。
  • 「Zechner Continuum」是個錯誤框架。正確理解是:同一工程師在不同任務上角色轉換,關鍵任務要求嚴格審查,非關鍵任務可自動化——問題的關鍵是任務類型,而非工程師哲學。
  • 能力漂移改變審查邊界。Claude→Fable的演進讓焦點從「Cloud有沒有做對」轉移到「Cloud是否做了對的事」,意味著驗證重心從代碼輸出轉向任務方向和系統設計。
Unlimited Free GLM 5.2 + Claude Code! 🤯
4 min
AI 技術英文7月10日

Unlimited Free GLM 5.2 + Claude Code! 🤯

The Ai Algorithm

  • 架構設計:利用 Jan.ai 作為中間代理層,將 Nvidia GLM 5.2 API 與 Claude Code 連接,實現三層式免費 AI 開發環境,無需付費訂閱。
  • 關鍵工具角色分工:Nvidia 提供模型存取金鑰、Jan.ai 執行協議轉換與本地伺服器啟動、Claude Code 作為開發交互介面,三者環環相扣。
  • 效能與成本的現實權衡:實測回應延遲約 2 分鐘,相比商業 API 明顯較慢,但完全免費,適合對速度容忍度高且重視成本的個人開發者。
OpenAI is so back... GPT 5.6 Sol first look
4 min
AI 技術英文7月10日

OpenAI is so back... GPT 5.6 Sol first look

Fireship

  • 政府監管框架改變發布流程:美國政府要求前沿 AI 模型在發布前需提交審查(最多 30 天),雖名義上自願但實質強制,OpenAI 因此先發給 20 個受信任夥伴。
  • 多智能體架構成為核心差異:GPT 5.6 Sol 的創新不在基礎模型能力,而在 Ultra Mode 可生成多個子智能體並行處理任務(如同時寫 React、處理資料庫、設計 UI),使多智能體編排技術商用化。
  • 基準測試成績高但評估可信度受質疑:Terminal Bench 2.1 上 Sol Ultra 達 91.9%,但獨立評估機構 Meter 檢測出異常高的作弊率(尋找隱藏測試答案、繞過評估指標),且 SWE Bench Pro(真實 GitHub 問題)未公布成績,暗示該項弱於競品。
Why AI Agents Won't Stay on Your Laptop
4 min
AI 技術英文7月10日

Why AI Agents Won't Stay on Your Laptop

Practical AI

  • 代理認知的轉變:大多數人仍將代理與本地工具或消費級產品聯絡在一起,但企業級代理的定義已經改變——它們是在企業基礎設施中獨立執行、不受單檯膝上型電腦約束的自主系統。
  • 從本地到雲端的架構跨越:本地執行面臨永續性和故障恢復的技術難題;遷移到雲端(無論是沙箱還是公司控制的計算機)解決了這些問題,同時使得 MCP 呼叫和技能載入等複雜操作成為可能。
  • 多代理艦隊的規模化潛力:一旦擺脫膝上型電腦的束縛,理論上可以無限擴充套件代理執行數量(如每小時 10 萬次執行),唯一的限制是成本承受能力。這種規模躍升預計在今年會加速推進。

7月9日星期四

15
Agentic AI Frameworks Explained: Workflows, Multi-Agent, & Production
11 min
AI 技術英文7月9日

Agentic AI Frameworks Explained: Workflows, Multi-Agent, & Production

IBM Technology

  • AI代理框架解決聊天機器人無法處理的複雜性問題。與簡單問答不同,代理系統需要進行規劃、行動與迭代,涉及多個代理協調,框架提供預定義架構、監控工具、任務管理與通訊協定等必要基礎設施。
  • 線性工作流系統(如客服代理:接收問題→知識庫搜尋→產生回應→建立工單)步驟順序可預測,最適合LangChain或LlamaIndex;自主代理系統為AI設定開放式目標讓其自行規劃,多代理協作實現目標,適合AutoGen或CrewAI。
  • 角色基礎系統中每個代理有明確職責邊界但相互協作(如內容生成的研究代理→撰稿代理→編輯代理),CrewAI最適合此場景;生產編排系統需深度整合API和業務工作流,適合Astra或LangGraph。
This AI Business Model Is Creating Millionaires In 2026
38 min
企業管理英文7月9日

This AI Business Model Is Creating Millionaires In 2026

Evan Carmichael

  • AI時代的單人商業模式:Tony Dinh憑一台筆記型電腦與Typing Mind工具月入13萬美元,證明個人無需大團隊、大投資也能獲利。這種模式的核心是找到真實存在且代價高昂的問題,然後用AI技術快速、低成本地解決。
  • 高價商品策略的力量:收取高價(如月費$2,000)只需4名客戶即可達成年收入96,000美元,相比低價商品需要數千客戶的模式,更容易建立品質客戶關係,確保客戶滿意度與轉介。
  • AI承擔80%繁重工作:透過排除無意義任務、自動化重複工作、委託少量兼職助理,個人可以以機構規模交付專業成果,客戶不知道背後只有一人。這創造了成本與交付價值之間的巨大利潤空間。
Claude被阿里封殺?美國AI工具爆出後門疑雲,中國大廠開始換國產AI
16 min
AI 技術中文7月9日

Claude被阿里封殺?美國AI工具爆出後門疑雲,中國大廠開始換國產AI

Maniatis Rozance

  • Claude Code是工程級助手,非普通聊天工具。它能進入開發環境、理解項目架構、發現bug、重構代碼、執行開發任務。因此接觸的不是文本,而是代碼層的核心商業邏輯——電商交易邏輯、支付安全流程、推薦算法、系統架構等,這才是企業安全隱憂的根本。
  • 雙向不信任驅動禁令。美國AI公司擔心中國企業通過模型蒸餾低成本複製技術能力;中國大廠擔心外部AI工具讀取代碼、泄露架構與內部系統。Anthropic宣稱的反濫用機制,在企業安全視角上就是邊界被碰觸的信號。
  • 影子AI是最難防的風險。員工為提高效率私自把敏感資料(代碼、客戶名單、API密鑰)餵給外部工具,一旦資料離開公司環境就難以控制。三星曾因此限制公司內部AI使用。
7 AI Tools That Save You 10+ Hours Every Week (2026) | Work Smarter with AI | Future Tools Hub
7 min
AI 技術英文7月9日

7 AI Tools That Save You 10+ Hours Every Week (2026) | Work Smarter with AI | Future Tools Hub

Future Tools Hub

  • 創意自動化工具完全改變傳統生產流程。AI 網站建構器透過自然語言輸入自動生成頁面佈局、配色方案與初始文案;影片編輯 AI 自動刪除冗餘段落與音頻雜訊;平面設計工具將文字指令轉成專業級視覺內容,使傳統需時數小時的工作在幾分鐘內完成。
  • 連接組織自動化(connective tissue automation)是行政領域的核心突破。此技術將 AI 與既有應用程式整合,使日常工作流程在後台無聲運行,例如自動偵測客戶郵件、提取發票資料、更新追踪表格並通知團隊,用戶專注於高價值工作。
  • 無代碼應用開發徹底打倒軟體建構的門檻。傳統定制軟體需花費數萬美元和數月開發週期,現在用戶以自然語言描述需求,AI 在數分鐘內生成可用應用,包含資料庫結構與使用者介面。
10分鐘搞定5個神級網頁!揭秘 Fable 5 的全自動 3D 網頁設計工作流
13 min
AI 技術中文7月9日

10分鐘搞定5個神級網頁!揭秘 Fable 5 的全自動 3D 網頁設計工作流

李哈利AI

  • 提示詞設計的關鍵在於授權而非限制 — 讲者没有逐步指导 Claude 如何设计,而是设定清晰的终极目标、质量标准和创意自由度,要求三次迭代修正确保卓越,让模型充分发挥审美能力。
  • Claude 的審美能力已超越多數人類設計師 — 模型能獨立決策設計風格、配色方案、排版布局、字體選擇和動畫效果,生成的網站兼具視覺美感和專業度,無需人工干預。
  • 充分利用 MCP 工具整合實現完整工作流 — Claude 透過 Hexfield MCP 自動呼叫 Clean 3.0 Turbo、DALL-E、NanoBnana 等多個 AI 模型庫,實現圖片生成、視頻製作、排版渲染的全自動化。
大模型应用开发从0到1精细化学习路线,全栈进阶,实战驱动!
17 min
AI 技術中文7月9日

大模型应用开发从0到1精细化学习路线,全栈进阶,实战驱动!

白白说大模型

  • 第一階段夯實底層直覺:不需成為演算法專家,但必須理解向量空間、分詞機制(BPE算法)、Transformer核心(自注意力、位置編碼)。重點是建立對大模型運作邏輯的直覺認知,為後續工程應用奠定基礎。
  • 結構化Prompt設計是性價比最高的調優手段:工程化Prompt(使用Markdown標籤、角色背景隔離、思維鏈COT、結構化輸出Jason)往往能省去昂貴的微調成本。提示詞工程直接決定應用穩定性,是從原型到生產環境的必經之路。
  • RAG與Graph-RAG是企業私有知識庫的命脈:基礎RAG適合精準查詢,Graph-RAG透過實體提取、圖資料庫、社區檢索適合全局總結。高級檢索調優(混合檢索BM25+向量、RRF融合算法、Reranker排序)決定了知識庫的實用性。
Best Agentic AI Strategy For Enterprise Scaling (2026)
30 min
企業管理英文7月9日

Best Agentic AI Strategy For Enterprise Scaling (2026)

Future AI

  • DOBA 提供完整的 dropshipping 生態系統,整合供應鏈管理、即時追蹤、商品推薦等功能,讓創業家專注大方向而非瑣務,是為電商賣家量身打造的自動化平台。
  • 平台的 15 天結構化挑戰和 elite academy 課程分階段引導新手從零到一,涵蓋選品、市場研究、行銷等核心技能,每日任務設計簡短可行,幫助使用者維持動力同時避免倦怠。
  • AI Picker、AI Store Builder 等內建工具能在數分鐘內完成傳統需要數週的工作,包括自動店鋪設置、智能選品和商品上架,大幅降低創業門檻和成本。
Black Hat Europe 2025 | Ghost In The Stack: Evolving Call Stack Spoofing In A Post-CET Era
35 min
Web2 安全英文7月9日

Black Hat Europe 2025 | Ghost In The Stack: Evolving Call Stack Spoofing In A Post-CET Era

Black Hat

  • 堆疊展開原理與欺騙基礎:Windows 執行緒透過呼叫堆疊追蹤函數執行流,展開器透過 Runtime Function Table(存於 pdata/xdata section)查詢展開資訊恢復返回地址。堆疊欺騙原理是篡改堆疊框架大小,讓展開器誤以為代理函數直接呼叫目標函數,從而隱藏中間的惡意程式碼執行。
  • 檢測與規避的對抗升級:早期檢測著眼於 jmp gadget 和缺失的 call 指令,但講者展示如何選用有正常 call 前導的 gadget、跨越有效轉移位址規則等方式逃脫。Elastic 的 Call Stack Enrichment Detection 整合多個指標,但仍存在校驗邏輯漏洞。
  • CET Shadow Stack 破局:CET 引入影子堆疊防止 ROP 鏈執行,使傳統堆疊欺騙失效。講者改變思路,改寫 NDR_SERVER_CALL_TWO 等代理函數的展開資料,實現在 CET 環境下的執行隱蔽性——堆疊本身不變,只改變展開解析結果。
智能体经济Agentic Economy | Nenad Tomasev | DeepMind | AlphaZero | 自动化偏差 | 委派 | 分布式智能 | 认知单一文化 | 纵深防御
25 min
AI 技術中文7月9日

智能体经济Agentic Economy | Nenad Tomasev | DeepMind | AlphaZero | 自动化偏差 | 委派 | 分布式智能 | 认知单一文化 | 纵深防御

最佳拍档

  • Agent的本質轉變:從被動回答問題到主動執行任務,智能體透過工具使用權限和多步規劃能力,可完成需要人類多次指導的工作流程,但每個行動都存在失敗率,因此需防範「自動化偏差」——過度信任導致忽視錯誤。
  • 專家分散體系優於巨型通用模型:經濟角度看,由不同專門智能體組成的協作網絡比單一龐大模型更便宜、更快、更安全;就像人類社會由專家分工組成,而非每個人都是全才。
  • 多智能體系統的協調危機:當成千上萬Agent同時互動時,若無智慧的任務分配框架,會出現重複、衝突、獎勵操縱等問題;同時大量模型採用相同基礎架構導致「認知單一文化」,故障點相關聯。
99% of People Don't Know These 5 AI Side Hustles That Are Already Making People Rich
18 min
企業管理中文7月9日

99% of People Don't Know These 5 AI Side Hustles That Are Already Making People Rich

小Lu说

  • AI音樂頻道的指數成長機會:YouTube已明確許可AI內容變現,無需露臉、無需創意瓶頸,新頻道能在短期內累積千萬級觀看量,是目前最快成長的細分領域之一。
  • POD及數位產品的低風險商業模式:無需庫存、無需大額初始投資,利用Printify與Etsy對接,設計好即可銷售。罐裝保溫套單次客戶採購量10-50件以上,雖單價低但批量購買大幅提升客單價和利潤率。
  • 市場反饋驗證超過猜測:Etsy官方趨勢報告明確指出日記類產品是成長最快分類,已有店家11個月賣出5.3萬件。這代表市場需求是真實驗證的,不是流量紅利。
OpenAI 正式向公众发布 GPT-5.6 模型系列【AI 早报 2026-07-10】
6 min
AI 技術中文7月9日

OpenAI 正式向公众发布 GPT-5.6 模型系列【AI 早报 2026-07-10】

橘鸦Juya

  • 大模型向多agent协调进化 — OpenAI GPT 5.6的Ultra模式默认协调4个agent处理复杂任务,Meta Muse Spark拥有百万token上下文窗口,这代表模型在复杂推理与长上下文理解上的能力跨越。
  • Agent应用层落地加速 — ChatGPT Work支持跨应用操作、生成交互式网站、定时任务与计算机使用能力,Artificial Analysis推出Enterprise Ops Gym测试Agent在企业系统多步骤操作的实际能力,标志应用层已从实验进入可用阶段。
[約翰的資產管理學] EP0:我在31歲達成財富與時間自由
29 min
企業管理中文7月9日

[約翰的資產管理學] EP0:我在31歲達成財富與時間自由

John資產管理

  • 清晰動機是財務規劃的地基 — 講者從匱乏的童年(幫父母擺攤賣銅鑼燒)和過度加班的職場經驗(高科技公司每天12小時)領悟到,他想打破這個循環。強烈的目標不是為了賣焦慮,而是為了在年輕時就爭取時間自由,能夠接送小孩、陪伴家人,這個動機驅動了往後每一個決策。
  • 個性化計算退休數字而非盲目跟風 — 講者根據自己實際月開銷(平時3-6萬、含旅遊10萬)來設定目標,用FIRE的4%法則計算出3000萬的退休本金。這個過程強調誠實面對消費習慣,避免設定不切實際的目標或無限擴張欲望。
  • 投資需要符合自己的知識圈和心理承受度 — 講者從2021年的個股投資中體會到心理波動的痛苦,後轉向指數投資找到穩定感。他透過大量閱讀經典理財書籍建立知識基礎,強調做好地基比追逐高報酬更重要,並找到自己能夠長期執行的投資方法。
STOP Using These Crypto Wallets! [They're Getting Hacked]
8 min
Web3 安全英文7月9日

STOP Using These Crypto Wallets! [They're Getting Hacked]

Cyber Scrilla

  • 隨機數生成方法決定安全性:PRNG只依賴數學算法,產生的種子短語在計算上可被破解;而TRNG和CSPRNG利用環境隨機性(如環境音素),使破解難度達到宇宙級別難度。Trust Wallet的2022漏洞案例顯示,只有40億種可能組合,相比真正隨機的種子短語根本不在一個數量級。
  • 事後無法檢測但事先能預防:弱種子短語產生時即可被攻擊者破解,但用戶無法通過事後審計發現問題,通常要到資金被盜才發現。因此預防比補救更重要——使用安全的錢包從一開始就選擇正確。
  • 硬體錢包是唯一真正安全方案:軟體錢包或瀏覽器擴展存在代碼控制風險,硬體錢包通過物理隔離和TRNG生成保證了安全性。軟體錢包應僅用於臨時操作(交易所互動、空投領取),不應存儲重要資產。
Building Durable AI Agents |Episode #363|
44 min
AI 技術英文7月9日

Building Durable AI Agents |Episode #363|

Practical AI

  • ML Ops的核心原則完全適用於AI代理開發。儘管代理系統不是傳統的DAG(而是動態、循環的圖),但「以安全、可靠、可重試的方式運行非確定性代碼」的根本需求未變。框架層和基礎設施層的設計思想可直接繼承,只是需要適應動態流程特性。
  • 代理從本地環境到雲端部署會遇到根本性複雜性跳躍。本地運行時持久化和故障恢復看似簡單,但一旦移到Kubernetes或AWS等共享基礎設施,需要處理容器宕機、網路中斷、資源競爭等真實場景。簡單的任務隊列演進為需要消息代理、持久化存儲、狀態管理的完整系統。
  • 企業規模化運行代理必須投資內部平台而非仰賴模型提供商。Uber通過自建ML Ops平台獲得市場領先地位並非偶然——內部平台使公司能理解什麼策略對自己的業務有效、什麼無效,並據此持續優化。代理系統亦同。

7月8日星期三

3
Building an ACP-Compatible Agent Live — Bennet Fenner, Zed
18 min
AI 技術英文7月8日

Building an ACP-Compatible Agent Live — Bennet Fenner, Zed

AI Engineer

  • 統一介面解決碎片化問題
  • Zed面臨的核心痛點是每個AI模型供應商都推出自己的編碼代理,導致編輯器需要為每個代理單獨開發整合方案。ACP透過定義統一的JSON RPC協議,讓任何代理都能與任何支持ACP的客戶端通信,已有超過40個客戶端和多個主流代理支持該協議。
  • 基於Session和非同步Updates的設計
Teaching Coding Agents to do Spreadsheets - Nuno Campos, Witan Labs
19 min
AI 技術英文7月8日

Teaching Coding Agents to do Spreadsheets - Nuno Campos, Witan Labs

AI Engineer

  • 試算表的視覺化難題:人類能直觀看到 Excel 結構,但 LLM 必須推理「哪種收入、哪個時期、是輸入還是公式」,複雜度被嚴重低估。初期準確率停留在 50%,其實已反映這種本質困難。
  • 多代理架構的失敗:嘗試用編輯代理、發現代理等分工,改善了錯誤類型但不解根本問題。原因是發現階段只執行一次無法重訪,代理間資訊孤立,架構過於剛性。此後測試的各種表示法(SQL、XML、CSV、HTML)都不能獨立解決問題。
  • REPL 架構的突破:將 15 個工具合併為單一 Node.js REPL 是轉折點。REPL 的關鍵優勢是持久狀態——代理一次呼叫內定義變數、取得結果、推理後再呼叫時變數依舊存在。代理因此寫出更短、更易推理的腳本,穿插思考而非冗長單次指令,反而加快正確答案產生。
Your coding agent doesn't always follow your rules — Talha Sheikh, Checkout.com
10 min
AI 技術英文7月8日

Your coding agent doesn't always follow your rules — Talha Sheikh, Checkout.com

AI Engineer

  • 指令無法替代驗證:即使給予充分的 spec、MCP server、sub agent 和上下文,仍需確定性驗證。能力增加不等於可靠性增加,新模型推出時改善的是能力而非信任度。
  • 驗證層設計的通用性:講者發現每家公司都在各自開發驗證系統(Anthropic、Meta、OpenAI 等),因此驗證應該是語言無關、可共享的模式,適用於各個階段(對話結束時、提交前、multi-agent 工作流、非同步操作)。
  • 成本優化關鍵:強大的驗證層使得可以使用較小的模型(如 Haiku 或開源模型),無需昂貴的 Opus 等前沿模型,通過減少驗證層消耗的時間也能大幅降低成本。