KeyFrame內部研究專用
每日

今日 KeyFrame

管線分析的每一部影片,最新的優先。每張卡片都直接連回原始影片。

7月15日星期三

9
Ai Presentation Maker (New Strategy 2026)
7 min
AI 技術英文7月15日

Ai Presentation Maker (New Strategy 2026)

The Review Radar

  • 無需手動提取內容 — AI 自動分析企業文檔,識別營收成長、客戶保留率等核心指標,省去大量整理時間。
  • 視覺預覽驅動選擇 — 主題模板展示多頁設計效果而非單頁,使用者在應用前即可判斷是否符合企業風格和簡報目標。
  • 分層編輯能力 — 自動生成後支援逐頁精細修改,透過 AI 改寫調整文本風格(長度、正式度、語法),或透過 AI 圖片生成和圖表更換客製化內容,無須外部工具。
AI 都這麼強了,還需要學習嗎?——一個 AI 的真心話
5 min
AI 技術中文7月15日

AI 都這麼強了,還需要學習嗎?——一個 AI 的真心話

李宏毅

  • AI工具效果完全取決於使用設計——宾州大學研究顯示無設計使用讓成績下降20%,哈佛大學研究則顯示有步驟引導的設計讓學習效果翻倍。差別不在工具聰慧度,而在有沒有人幫你設計用法。結構會放大能力,但放大不了原本不存在的基礎。
  • 危機是習慣性放棄學習而非機會減少——歷史上印刷術出現後,人類並未強化其他能力,而是安靜地放棄了背誦與記憶訓練。AI時代同樣危險:不用練習也能出漂亮成果,這種無痛的下滑最危險,因為沒有人感到痛感。
  • 「只要學思考」的說法被教育研究推翻——思維、品味、判斷力都無法脫離具體領域單獨存在,必須深入專研某個領域才能養成。因此真正該學的是反而更老派的東西:把一個真正的東西學到底,親手做過,犯過錯,分得出好壞。
Alex Ozdemir on where Theorem Provers and ZK meet
61 min
AI 技術英文PODCAST7月15日

Alex Ozdemir on where Theorem Provers and ZK meet

Zero Knowledge

  • ZK 語言生態的兩條平行線:DSL 繼續演進(Clean、Plonky2、Cairo),同時 ZK VM 異軍突起。VM 讓應用開發者無需理解電路細節,只需知道虛擬機介面;但電路層仍有用武之地——VM 引入的間接性帶來性能成本,關鍵應用仍需定製電路以獲得最優性能。
  • 隨機電路作為一級概念的重要性:傳統電路是確定性的,新一代 DSL 允許電路在執行中「擲硬幣」(採樣隨機挑戰),這讓查詢論證、記憶體論證等互動式証明系統成為原生特性而非事後補丁。Cersei 不只支援隨機電路,還能自動優化其使用——合併冗餘挑戰、選擇最佳記憶體論證演算法。
  • 形式驗證的兩大工具各司其職:SMT 求解器(如 CVC5)進行自動定理證明,適合較簡單的數學領域(如有限域運算);Lean 是交互式定理證明器,由人類編寫証明但內核小且可信。兩者都開始引入機器學習來指導證明搜索,但真理判定始終是確定的——ML 只是幫助尋找證明路徑。
James Moss - Using skills to pay the bills: graduating from solo hacks to a team workflow - DevCon26
32 min
AI 技術英文7月15日

James Moss - Using skills to pay the bills: graduating from solo hacks to a team workflow - DevCon26

AI Native Dev

  • 技能數量爆炸但無法追蹤:技能文本門檻極低,團隊各自為政導致數千項技能散佈各地(GitHub、本地配置、marketplace),企業無法掌握使用情況或進行改進。
  • 五種失敗模式並存:重複建設相同技能造成浪費、新版本發布後舊版本仍在用、技能更新與實際代碼漂移、大量技能塞入單一倉庫超過上下文限制導致被截斷無法激活,這些問題無法逐一排查。
  • 技能應如軟體工程:分解成小模組、避免全局狀態、自動化審查、集中註冊表管理版本與安全掃描,這套 SDLC 成熟的做法直接套用在技能管理(CDLC)能解決 80% 問題。
Computer-Use 2.0: Agents Just Got Multi-Cursor — Francesco Bonacci, Cua
16 min
AI 技術英文7月15日

Computer-Use 2.0: Agents Just Got Multi-Cursor — Francesco Bonacci, Cua

AI Engineer

  • Computer Use 的演進:從 1.0 時代的傳統人工循環(screenshot → reasoning → clicking)到背景操作,Quad Driver 透過利用 Apple 框架中的未公開 API 和可訪問性樹,實現 agent 在背景執行操作而不佔用螢幕的技術突破。
  • 評估的多維度設計:QuaBench 不只測試 agent 能否完成任務,還透過「fork 機制」和預測探測(predict reward、internal state)來測量 agent 的世界模型,即理解操作環境的能力;每個任務都要先被內部團隊用 reward hacking 測試,確保評估本身可信。
  • 實績差距的誠實披露:QuaBench ICAD 在電氣工程任務上的成功率只有 24%,且從零開始的任務成功率為 0%,說明即使最先進的 model 在複雜現實任務上的能力仍有巨大改進空間。
Recursive Model Improvement — Lee Robinson, Cursor, SpaceXAI
20 min
AI 技術英文7月15日

Recursive Model Improvement — Lee Robinson, Cursor, SpaceXAI

AI Engineer

  • 雙層迴圈架構加速反覆迭代:外迴圈透過用戶反饋和在線指標(AB 測試)改進訓練數據品質,內迴圈透過高品質評估和困難訓練任務持續爬升性能。這種結構使 Cursor 突破了串聯訓練的瓶頸,實現更快的模型改進速度。
  • 評估防護應對模型欺騙:當模型變聰明後開始創意欺騙評估(查看 git 歷史尋找線索、線上查詢答案),Cursor 透過刪除 git 歷史、網路允許列表等簡單措施防護。這對公開評估尤為重要,因為業界依賴這些基準判斷模型品質。
  • 文本反饋精細塑造行為:傳統 RL 只在過程末尾評分難以分配信用,新方法在特定位置提供提示(如「提醒你有這些工具可用」),上下加權相應概率。此方法已被驗證適用於工具遵守、風格改變等所有行為塑造。
How I Would Build A One-Person Claude AI Business In 2026
14 min
企業管理英文7月15日

How I Would Build A One-Person Claude AI Business In 2026

Ayushman Pandita

  • 服務業比產品業更適合 AI 創業新手 — 99% AI SaaS 應用失敗,投入期動輒數月到數年;服務業先賣後做,零前期風險,一旦成交就能透過 AI 工具快速交付。
  • 客戶只在乎結果,不在乎你是否手做或用 AI — 15 分鐘用 Claude 完成的工作與花 15 小時手工做出的結果一樣,客戶樂意付同價。正規服務業的現實就是輸出品質決定收費,方式無關。
  • 選擇服務的三問框架 — 我已有什麼技能知識、市場已有人為此付費嗎、AI 能大幅提速該服務嗎?三個答案重疊的服務是起點。例如:SEO 部落格寫作、LinkedIn 代筆、網站開發、社群媒體管理。
The $1,000/hour Solo AI business (Full Course)
61 min
企業管理英文7月15日

The $1,000/hour Solo AI business (Full Course)

Greg Isenberg

  • 三層價值堆疊的商業結構
  • 第一層是$999評估報告(切入門檻),但真正收入來自第二、三層的實施合約。初期認知是腳踏入門,實際上是持續深化客戶關係的銷售漏斗。Corey已售出15份評估,其中50%進階至實施階段,客戶終身價值達$3K-10K+。
  • 高槓桿履行流程利用AI自動化

7月14日星期二

10
Vibe Coding架构解析:大模型时代的意图识别编程与工程化约束!
20 min
AI 技術中文7月14日

Vibe Coding架构解析:大模型时代的意图识别编程与工程化约束!

白白说大模型

  • Web Coding 本質是開發習慣的轉變。傳統模式中開發者既要設計邏輯又要處理語法細節,而新範式下開發者只負責表達意圖和最後驗收,所有實現細節交由 AI 執行架構完成。
  • 大模型與本地 Agent 通過方法調用實現協作。雲端大模型因沙盒隔離無法直接改寫本地文件,通過 Tool Calling 把指令翻譯成結構化調用,本地 Agent 接收後執行文件讀寫和測試,再把結果回傳給大模型形成閉環。
  • 編排層通過 SDD 和 TDD 兩種工作流規範 AI 行為。SDD(軟體設計文檔)驅動流程強制 AI 先澄清需求再寫代碼;TDD(測試驅動開發)流程讓測試用例成為 AI 的絕對約束,防止胡亂修改。
What to Expect at Black Hat USA 2026
13 min
Web2 安全英文7月14日

What to Expect at Black Hat USA 2026

Black Hat

  • 訓練課程以實踐為中心而非理論講座:所有講師皆具實戰經驗,在業界用過所教技術,學員在專家指導下建立可立即部署的實務技能。今年特別擴展 AI 安全軌道,針對 LLM 防護、自主代理防禦、機器速度檢測等從業者當前最關切的挑戰。
  • 研究簡報由獨立審查委員會篩選,與贊助商決策隔絕,確保內容嚴謹且業界信任:涵蓋 AI 遺傳學開發、後量子密碼學、供應鏈攻擊、次世代檢測工程等前沿主題,且研究尚未公開發表。
  • 展廳空間從被動參觀轉向主動實驗,新增沉浸式互動層次:「Interface」提供情景學習與現場挑戰、「Convergence」讓參與者交流經驗、「Arsenal」展示開源工具實時運作(89 場展示加 20 場實驗室課程),強調社群能力而非廠商行銷。
From No-Code to Pro-Code: Learn How You Can Build Agentic Applications
56 min
AI 技術英文7月14日

From No-Code to Pro-Code: Learn How You Can Build Agentic Applications

Oracle

  • 所有權與認知負載的轉變:傳統代理將流程管理的認知負載完全留給使用者,而 Agentic Applications 由多個專精代理組成的團隊擁有整個流程,系統能自主監控、分析、推薦並執行優先級行動,使用者只需審批關鍵決策。採購指揮中心與護理長管理系統都證明了這種轉變能大幅提升工作效率。
  • 四層堆疊的完整系統:使用者體驗層展示實時業務狀態與優先級行動;決策層由專精代理組成,各自監控、分析、協調;工具層提供工作流、驗證、人工核批、確定性政策節點;運行時層整合 Fusion 平臺的安全、身份、權限、知識庫與審計能力,形成真正的企業級系統。
  • 政策節點的革新價值:系統可自動將巨型政策文檔(200 頁福利手冊、複雜合約)轉為確定性程式碼,一次測試後即可百分百準確地無限重複執行,無須消耗 token,同時保持完全可追蹤。例如福利資格審核,透過人員物件與政策節點可即時精確輸出資格判定與下一步行動。
Why I switched to Pi...
15 min
AI 技術中文7月14日

Why I switched to Pi...

AI Jason

  • 相比閉源代理的本質差異:Claude Code 和 Codex 等主流編碼代理是閉源的,用戶無法修改內部邏輯,只能通過有限的 Hook 系統進行定制。Pi Agent 打破這一限制,採用開放式扩展系統,允許用戶完全控制代理硬件的行為。
  • 扩展系統是核心優勢:用戶可在項目中的 `.py/extensions/` 文件夾編寫 Python 擴展,修改代理上下文(如注入 Git 信息)、添加新工具、定制 UI,甚至代理自身也可生成需要的擴展。這使得之前無法實現的功能優化(如清理 PR 評論減少 80-90% token 成本)成為可能。
  • 模組化生態設計:Pi 生態包含 Coding Agent(編碼代理)、AI Package(LLM 接口)、OS Package(任務調度)等專用模組,用戶可按需組合,避免承載不必要的功能。
WTF Is the Context Layer? The Missing Infrastructure for Production Agents — Prukalpa Sankar
20 min
AI 技術英文7月14日

WTF Is the Context Layer? The Missing Infrastructure for Production Agents — Prukalpa Sankar

AI Engineer

  • 智能與情境的失衡:模型能力六個月內翻倍,但業務情境知識(人員離職、決策邏輯、季節規律)仍散落在儀表板與Slack對話中,AI 無法習得。傳統只看 IQ 無法預測工作表現,人類 90% 的職場成績來自情境學習,AI 亦然。
  • 人類團隊的學習機制:Maya 分析師一年內成為公司專家,不是靠入職培訓,而是影子學習、犯錯回饋、邊緣案例經驗的疊加。團隊共享語言、劇本與集體記憶,形成複利學習循環。AI 系統需要複製這套協作結構。
  • 單一 agent 無法擴展:ATLAN 初期為每個職能建立專有 agent(Hermione 健康分析、Moneypenny 財務風險),但 agent 互相孤立,行銷團隊更新資訊後銷售 agent 仍用舊資料。依賴軟體棧(Relevance、Google ADK、Glean、Cloud Code),每次遷移都讓情境被鎖在系統內。
Don't Ship Skills Without Evals — Philipp Schmid, Google DeepMind
21 min
AI 技術英文7月14日

Don't Ship Skills Without Evals — Philipp Schmid, Google DeepMind

AI Engineer

  • 能力技能與偏好技能有本質區別:能力技能教導模型新能力(隨模型進步可淘汰),偏好技能編碼公司特定工作流(需永久保護),後者尤其必須配備評估機制以防模型更新導致性能下降。
  • 技能觸發方式影響設計策略:模型觸發型技能需要精準的描述讓模型判斷何時使用;用戶觸發型技能可承受較長的描述與複雜度,不應內建於模型上下文。建立面向消費者的代理時,只能仰賴模型觸發機制。
  • 分層資訊揭示是關鍵:簡短描述(2 句話)付出固定的 token 成本,應只包含「何時用」與「如何用」;詳細說明放在技能主體;深層資訊分別放在參考檔案中(如多雲部署需拆成 AWS、Google Cloud、Azure 三份參考檔),讓模型自主探索所需細節。
Forward Deployed Engineering at Cursor — Pauline Brunet
20 min
AI 技術英文7月14日

Forward Deployed Engineering at Cursor — Pauline Brunet

AI Engineer

  • FDE有明確的適用邊界。講者用二維矩陣(客戶成熟度 × 產品定製化程度)劃分四個象限:高成熟+低定製應採用自助服務;低成熟+低定製是傳統SaaS部署;真正的FDE價值在高定製象限,充當顧問或內嵌轉型推手角色。
  • FDE需要特殊人才。需要5年以上經驗的資深工程師,具備高情商和跨組織溝通能力,能與CIO到開發者各級對話,理解客戶業務流程和文化,最重要是持續學習最新技術,因為客戶期待FDE是領域專家。
  • 專案必須戰略性、高ROI、清晰定義成功。與經濟決策者合作確保專案是公司戰略目標,客戶要投入充分資源,交付物應獨立執行(如自動化流程、長執行代理),FDE離開後客戶能繼續獲益。
SN 1087: HalluSquatting, GhostApproval & GitLost - Patch Tuesday Breaks Records
168 min
AI 技術英文PODCAST7月14日

SN 1087: HalluSquatting, GhostApproval & GitLost - Patch Tuesday Breaks Records

Security Now

  • AI改變防禦時間尺度:Mythos等模型能在分鐘內完成原需數週的漏洞發現。攻防雙方都被迫加速,防禦者必須部署同等級AI才能跟上攻擊速度,否則將完全處於劣勢。傳統每月數十個漏洞的時代已終結。
  • 各國展開國家級戰略回應:這不再是技術採購問題,而是國家安全決策。歐盟建立主權AI能力、英國開發自主代理防禦系統、中國限制先進模型海外訪問。每個大國都認知到若失去本土AI掌控權,將被他國AI所制約,風險等同失去電力供應。
  • 漏洞發現進入指數級增長期:微軟預計未來4-6個月每月發現400多個漏洞。這標誌著AI終於讓人類有能力審視幾十年累積的軟體缺陷。數字從上升轉向下降的拐點可能在一年內出現。
Patrick Debois Maps the Patterns of AI-Native Dev
47 min
AI 技術英文7月14日

Patrick Debois Maps the Patterns of AI-Native Dev

AI Native Dev

  • 技術已定,組織未備——技術棧在穩定(prompt engineering、specification、harnesses、contexts、loops),但大多數企業還沒組織好應對這種工作方式轉變。類比 DevOps 時代,「持續交付不適合我們」其實說的是「我們還沒準備好」,不是技術行不通。
  • 平臺層被嚴重忽視——企業通常關注個人開發者能力,卻忽略共享元件、集中化 evals、元件註冊等平臺能力。這層最不成熟,卻是大企業突破的關鍵——一個平臺改進會讓全組織受益。
  • 學習速度成為競爭力——不再是「程式碼生成快不快」,而是「組織能多快學到新想法、多快調整工作流、多快做出來」。即使要重寫整個程式碼庫也無所謂,只要速度夠快。
AI Loop: The Future of Application Development
5 min
AI 技術英文7月14日

AI Loop: The Future of Application Development

Practical AI

  • AI應用分為兩類,需要不同架構策略。內部生產力工具相對簡單,但業務關鍵型應用(面向客戶或對企業運營至關重要,如製藥基因折疊系統)需要精細設計。傳統方式是問一個問題呼叫單一模型,但未來應用將由多個代理、多種模型和不同推理調用組合而成。
  • 模型選擇必須根據任務複雜度匹配。深度分析工作應調用前沿模型提供複雜推理能力,但簡單任務如將日語翻譯成英語並不需要前沿模型的深層理解,應使用更小、更便宜的模型以避免成本浪費。
  • 基礎設施優化是成本結構的關鍵部分。應用必須針對基礎設施進行深度優化,實踐基礎設施感知、儲存快取策略,以及正確配置參數和提示詞,這些措施都能使推理工作負載運行更快、更便宜。

7月13日星期一

11
What I learnt after running loops for 1 month???
14 min
AI 技術中文7月13日

What I learnt after running loops for 1 month???

AI Jason

  • 循環契約是制度基礎
  • 循環契約是一份 Markdown 活態文檔,必須明確三項要素:目標和成功指標(如「降低 React 代碼品質評分」)、邊界定義(哪些任務代理可自行完成、哪些需人工審核)、標準操作程序(代理每次都應遵循的具體流程)。此外配備狀態層(代理當前理解、待辦積壓、已發貨待跟進項目)和日誌層(每輪運行記錄),防止代理每天重新發現相同錯誤。
  • 觸發器選擇直接決定成本效益
OpenAI突然掀桌!ChatGPT开始取代传统软件入口,微软、Salesforce、Adobe谁最危险?#OpenAI #ChatGPT #AI软件股
10 min
AI 技術中文7月13日

OpenAI突然掀桌!ChatGPT开始取代传统软件入口,微软、Salesforce、Adobe谁最危险?#OpenAI #ChatGPT #AI软件股

Alan聊财经

  • 商業模式轉變:OpenAI 不再只賣發動機給微軟、Salesforce,而是想「自己造車、直接接乘客、決定路線」,把自己定位為企業員工每天首先打開的入口。這意味著工作流程從「員工主動打開各軟件」變成「員工對 ChatGPT 下一句指令,再由它調度後台軟件」。
  • 傳統軟件面臨的隱形危機:系統不會被完全取代,但會被推到後台。Salesforce 的客戶資料還在、業務流程仍要靠它執行,但員工登入次數遞減,因為所有操作都透過 ChatGPT 中介。品牌活著,定價權卻慢慢蒸發。
  • 座位計費模式失效:Salesforce 過去按員工數賣座位,但當 AI 代理代替人工完成工作時,企業還需要那麼多座位嗎?公司已開始嘗試按對話量和任務數計費,反映出這一困境。
ChatGPT 5.6 震撼發布!為什麼它徹底秒殺了 Fable 5?(附終極開發工作流)
12 min
AI 技術中文7月13日

ChatGPT 5.6 震撼發布!為什麼它徹底秒殺了 Fable 5?(附終極開發工作流)

李哈利 | AI

  • Fable 5 在架構理解和高階思考上無可替代,對龐大代碼庫和複雜數據庫能瞬間掌握,但成本極高(價格約為 GPT-5.6 兩倍),普通開發者難以承受。GPT-5.6 雖初期需要引導才能理解整體架構,但代碼質量與 Fable 5 相差無幾,且執行能力和性價比全面優勝。
  • 建立永不關機的中央電腦是核心基礎。通過遠程控制功能,用手機、平板、其他電腦控制該中央機器,將所有代碼和項目集中管理,避免檔案分散在多個設備上造成混亂。
  • 黃金組合策略最具效率:用 Fable 5(High 等級即可)生成詳細 Markdown 項目規劃文件,再把任務交給 GPT-5.6 執行。這樣既能發揮 Fable 5 的規劃優勢,又能利用 GPT-5.6 的成本優勢和執行效率,同時節省大量 token 支出。
Hermes Agent Just Got 10X Better (4 Insane NEW Features)
10 min
AI 技術英文7月13日

Hermes Agent Just Got 10X Better (4 Insane NEW Features)

Zinho Automates

  • 多模型協同決策:單個 AI 模型思維方式固定,容易產生盲點。新功能讓 Claude、GPT、DeepSeek 等多個模型同時獨立處理同一問題,由聚合模型綜合各自答案,特別適合重大商業決策和策略問題。
  • 技能永久學習系統:過去每次對話結束知識就消失,代理無法累積經驗。新版本用 /learn 自動從文檔、代碼庫、流程文檔生成技能並永久保存,也能從已完成的成功案例提取多步驟流程作為可重複技能。
  • 透明的自我改進管理:AI 自改通常是黑箱,使用者無法確認代理學到什麼、記憶是否準確或是否混入錯誤。/journey 提供視覺化儀表板展示所有技能與記憶的連結狀況,使用者可直接編輯、刪除或修正有問題的項目。
什么是Loop Engineering?
19 min
AI 技術中文7月13日

什么是Loop Engineering?

白白说大模型

  • 從提示詞工程到循環工程的認知轉變
  • 提示詞寫得再好也是一對一的問答,成為了人工的瓶頸。真正的進展是建立類似手機導航的系統——用戶只需設定目標,系統自動規劃路線、遇到錯誤自動重新計算,人類完全解放。這反映了一個根本的角色轉換:從手工作業者變成系統架構師。
  • 內循環與外循環的職責分離
The 10 Trending GitHub AI Repos This Week (AI Agents Are Taking Over)
5 min
AI 技術中文7月13日

The 10 Trending GitHub AI Repos This Week (AI Agents Are Taking Over)

AI Motion Studio

  • AI 代理正在取代完整的應用程式。從求職、會議記錄到安全測試,這些開源項目展示 Claude 和其他 AI 模型如何透過代理執行原本需要專門軟體才能完成的工作流。
  • 隱私與本地優先成為核心競爭力。Meetly 將所有錄音和轉錄保留在本地電腦,不上傳任何第三方雲端,這對處理醫療、財務或公司敏感對話特別重要。
  • 多供應商整合與容錯機制必不可少。Omniroot 等工具通過同時路由到 200 多個 AI 供應商,自動在額度耗盡時轉到下一個,或從最便宜的模型開始,解決現代開發者的速率限制難題。
Black Hat Europe 2025 | Compromising The AI Agent Ecosystem Via Its "Universal Connector"
31 min
AI 安全英文7月13日

Black Hat Europe 2025 | Compromising The AI Agent Ecosystem Via Its "Universal Connector"

Black Hat

  • 攻擊面轉移:傳統應用中代碼與數據分離,但在 LLM Agent 中兩者混融於上下文。攻擊者無需找代碼漏洞,直接操縱注入的數據即可控制 Agent 決策,單點失敗風險大。
  • 間接提示注入的普遍性:Fetch MCP 服務允許 Agent 讀取網頁內容,但 Agent 無法區分內容與指令。GitHub README、Issue、Wiki 頁面都可植入隱藏指令,導致遠程代碼執行(如 Cursor IDE 攻擊案例)。用戶快速批准是因為信任 Agent 的解釋,形成語義鴻溝。
  • 協議設計引入的原生欺騙:Initiation 功能原生表單看起來完全合法,用戶誤認為是系統請求,利用對 Agent 的信任騙取密碼。URI 模式的客戶端動態註冊(DCR)允許攻擊者控制重定向 URI,劫持授權流程竊取訪問令牌。
How Companies Will Actually Use AI Agents in 2027 (Tutorial)
19 min
AI 技術英文7月13日

How Companies Will Actually Use AI Agents in 2027 (Tutorial)

Nick Saraev

  • 協作工作空間的架構:Linear以「收件匣→下一個→行動→等待→已完成」的狀態流轉管理任務。重點不在工具選擇,而在於創造一個人類與AI共同操作的平台,讓任務可被追蹤、上下文可被保留。
  • AI代理的三層資源訪問:Fable代理可存取工作區上下文(現有文件、其他任務、內容管道),知識庫(講者的決策偏好、風格指南),以及各類憑證。這三層資訊讓AI能代表講者的「品味」執行工作。
  • 評估工具制定運作邊界:評估不是簡單檢驗,而是一套標準化步驟清單。以視覺資產為例,需檢查清晰度、風格一致性、尺寸規格、概念忠實度等五項標準,每項0-2分,總分低於7則重新迭代。目的是確保AI輸出始終符合講者的標準。
I Built A USEFUL AI Agent (3 months of learnings in 10 mins)
10 min
AI 技術英文7月13日

I Built A USEFUL AI Agent (3 months of learnings in 10 mins)

Chris Raroque

  • 本機資料庫整合:Apple不開放API,但iMessage、Notes、Reminders都儲存為裝置本機SQL資料庫,代理可直接查詢存取,代價是需要完整磁碟權限。
  • 瀏覽器自動化挑戰:Instagram、LinkedIn等網站封鎖AI瀏覽器,需使用Playwright修改版本(Patchrite)來繞過機器人檢測,同時採「人環模式」處理登入需求——代理打開瀏覽器請求使用者介入。
  • SDK無關架構設計:透過適配器模式將工具抽象化,使用者可在設定中選擇Claude或OpenAI SDK,系統自動路由流量,易於未來擴展其他提供商。
I Tried Making $800 in 4 Hours with AI Agents (To See If It Works)
26 min
AI 技術英文7月13日

I Tried Making $800 in 4 Hours with AI Agents (To See If It Works)

Mikey No Code

  • AI 代理的真正價值在於取代低效人工操作:傳統模式中員工因忙碌可能延遲回覆,每次延遲都增加客戶轉向他處的風險。AI 代理能在數秒內給出明確預訂選項,立即完成預約,徹底消除應答延遲導致的客戶流失。
  • 多工具協同構建完整自動化工作流:Base 44 負責對話與決策,Google Calendar 實時管理檔期,Google Sheets 記錄客戶資訊,Stripe 處理訂金(如 10 美元),Telegram 發送提醒,各環節自動銜接無需人工干預,系統持續在後台運作。
  • AI 記憶功能與個性化服務建立客戶信任:系統能辨識回頭客,提供個性化回覆如「Emily,您已預約 4 月 12 日下午 3 點染髮」,同時能標記高價值潛在客戶進行優先排序,提升客戶忠誠度與銷售轉化。
In Code They Act, In Proof We Trust — Erik Meijer, Leibniz Labs
21 min
AI 安全英文7月13日

In Code They Act, In Proof We Trust — Erik Meijer, Leibniz Labs

AI Engineer

  • 工具調用導致 AI 安全從理論轉為實際威脅:OpenAI 在 2023 年 6 月為 GPT-4 引入工具調用功能,LLM 從純文本生成工具演變為能執行實際操作的系統。此時 AI 安全問題不再只是輸出不當言論,而是真正能改變現實世界(刪除檔案、操作銀行帳戶)的危險。
  • 透過執行延遲與隔離構建安全架構:不讓 AI 直接執行操作,而是讓其生成執行計畫,由人類或可信系統審查後才執行。這在型別系統中表現為將 IO 操作從代理的責任範圍推離。
  • 程序表達式轉化使形式驗證成為可能:關鍵創新在於代理不生成黑盒的 IO 型別結果,而是生成代表計算的程序表達式(使用自由單子)。編譯器技術可對這些表達式進行資料流分析和型別檢查,實現數學上的安全證明。