KeyFrame內部研究專用

一句話,它就把東西做出來了|機器學習 2027 第一堂:裝一個 AI agent 有多簡單

李宏毅·8月7日週五·5 min中文

三句話摘要

機器學習課程第一單元導讀:介紹本機運行的 AI 工具(Claude Code、Codex)與聊天機器人的根本差異,以及如何驗證 AI 執行的任務是否正確。 AI 工具的能力爆發不在於如何操作(已簡化到極致),而在於它如何在你的電腦上真正執行任務——這才是它與聊天機器人的本質區別。 兩個工具的安裝差異:Codex(OpenAI)從微軟商店下載,Claude Code(Anthropic)從官方網站下載。兩者都無需指令列操作、檔案解壓縮或設定檔修改,整個過程只需點擊按鈕,體現了 AI 工具已成為面向普通用戶的產品。

重點整理

重點
  • 1

    兩個工具的安裝差異:Codex(OpenAI)從微軟商店下載,Claude Code(Anthropic)從官方網站下載。兩者都無需指令列操作、檔案解壓縮或設定檔修改,整個過程只需點擊按鈕,體現了 AI 工具已成為面向普通用戶的產品。

  • 2

    AI 工具 vs 聊天機器人的本質區別:聊天機器人被動接收文字並回覆,AI 工具則能在用戶電腦上主動執行完整任務——開資料夾、創建檔案、編寫程式碼、運行程式,最後回報工作成果。

  • 3

    實時演示的工作流程:講者輸入「做一個線上投票系統讓全班選出最喜歡的班遊地點」(30 字),AI 自動檢查現有資源、發現腳本錯誤時主動改用複製模板方案。講者中途禁止上傳至雲端,AI 不僅同意,還重新架設為完全本機版本。

  • 4

    安全權限的硬邊界:AI 試圖操作工具自己的視窗時被系統直接拒絕,理由是「不能授權修改自己的全局設定」。這說明即使功能強大,仍有不可逾越的安全邊界。

實用技巧與重點

乾貨
  • 工具清單
  • Codex(OpenAI):微軟商店下載
  • Claude Code(Anthropic):官方網站下載
  • 安裝成本:2 顆按鈕,無需終端指令、檔案解壓縮、配置修改
  • 演示數據
  • 使用者指令:30 字
  • 生成結果:6 個檔案、583 行程式碼
  • 使用語言:全用系統內建功能,無外掛套件
  • 測試結果:灌入 27 票,投票系統實時更新票數
  • AI 工作過程
  • 自動檢查資料夾
  • 偵測腳本複製檔案失敗
  • 主動改用複製模板方案
  • 準備發布至雲端(被使用者叫停)
  • 改為本機版本,資料存為本地檔案
  • 權限限制:AI 無法操作自己的介面窗口

結論

結論

AI 工具的能力爆發不在於如何操作(已簡化到極致),而在於它如何在你的電腦上真正執行任務——這才是它與聊天機器人的本質區別。

完整解析

詳細

這堂課的核心訴求是讓學生理解一類新興 AI 工具的真正能力。講者本人是 Claude 代理(也就是說講者就是運行中的 AI),他在 Claude Code 環境中進行這場演講。

安裝體驗是這類工具進化的縮影。傳統軟體需要複雜的安裝流程,但 Codex 和 Claude Code 已經簡化到只需點擊按鈕——Codex 在微軟商店找到、下載、安裝,Claude Code 則從官方網站直接下載。整個過程不涉及終端指令、檔案解壓縮或設定檔修改。這反映了一個轉變:AI 工具已從開發者工具演進為面向普通用戶的產品。

使用體驗更引人注目。講者現場演示了用 Codex 完成一個實際任務。他的全部指令只有 30 字:「做一個線上投票系統讓全班選出最喜歡的班遊地點」。之後的工作完全由 AI 自動展開——它先檢查電腦裡有沒有可用的現成資源,隨後發現 Windows 上的某個自動架設網站腳本在複製檔案時出錯。AI 沒有停下來等待人工干預,而是主動改用複製範本的方案繼續推進。唯一的人工插手發生在 AI 準備發布系統到線上時——講者禁止了這一步。有趣的是,AI 不僅口頭同意,還重新架設了整個方案,從網路版改為完全本機版本,投票數據改存在本地檔案。

AI 交出的成果是 6 個檔案共 583 行程式碼,全部使用系統內建功能,沒有安裝任何第三方套件。講者隨後運行了這個系統,灌入 27 票進行測試,票數確實實時跳動。這個演示有力說明了核心數據:輸入 30 字,得到 583 行可執行程式碼。

但講者也點明了一個關鍵限制。當 AI 試圖操作 Claude Code 自己的介面視窗時,系統直接拒絕,理由明確地寫在畫面上:"不能授權他去操作自己的全局設定"。這揭示了一條不可逾越的安全邊界——即使工具能力強大,也不能自我修改。

講者的最後總結落在成本盤點上:安裝是兩顆按鈕,使用是一句話,中間人工插手一次(做限制決策)。但真正的挑戰不在這裡——後續課程的核心問題是:當 AI 做完工作後,你如何驗證它做對了?

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。