KeyFrame內部研究專用

AI圈最近有点破防了,Agent不再是博士生高端局!

白白说大模型·8月6日週四·9 min中文

三句話摘要

AI 領域的 8 個核心概念(LLM、Token、Context、Prompt、Tool、Agent、MCP、Skill)及其能力進化鏈條,以及上海教授團隊發布的 Agent 學習路線。 AI 的 8 個核心概念並非孤立存在,而是一條完整的能力進化鏈——從理解人類語言,到具備行動能力,再到標準化協作和專業化表現——掌握這條邏輯架構才是真正的 AI 底層基本功。 大語言模型的真實運作方式:模型不是知識庫而是概率生成器,通過逐詞預測生成文本。因此它會產生幻覺(為了讓句子聽起來合理而非保證事實正確),但正因這種創造性也賦予了它寫詩、編故事、生成未見過代碼結構的能力。

重點整理

重點
  • 1

    大語言模型的真實運作方式:模型不是知識庫而是概率生成器,通過逐詞預測生成文本。因此它會產生幻覺(為了讓句子聽起來合理而非保證事實正確),但正因這種創造性也賦予了它寫詩、編故事、生成未見過代碼結構的能力。

  • 2

    Token 的經濟學意義:由於中文的 token 消耗量為英文的 1.5-2 倍,在生產環境中用英文改寫提示詞可直接節省成本 50%,這個細節對大規模 AI 調用有顯著的成本優化空間。

  • 3

    Context Window 的核心認知:AI 沒有真正的記憶,每次回覆都從零起點開始,完全依賴 context window 中現有的內容。往 context 裡塞什麼直接決定了模型的表現上限——塞得好是專家,塞得差可能像廢物。

  • 4

    Agent vs Tool 的本質區別:Tool 讓 AI 能執行任務但需人工逐步指導,Agent 則具備自主決策能力,能自行分析問題、選擇工具、調整方案、完成目標,從「聽話的工具人」進化成「項目經理」。

實用技巧與重點

乾貨
  • Token 消耗比例:中文 vs 英文 = 1.5-2 倍
  • 成本節省:改用英文 Prompt = 省下 50% 成本
  • 學習路線四階段
  • 第一階段:掌握核心理論(LLM、規劃、記憶、工具)
  • 第二階段:Agent 工作原理及難點方案、ReAct 等經典範式
  • 第三階段:多智能體協作、Prompt 調優技巧
  • 第四階段:實戰項目
  • 學習時間:一個月從新手進階到工程師級別
  • 8 個核心概念:LLM、Token、Context Window、Prompt、Tool、Agent、MCP、Skill

結論

結論

AI 的 8 個核心概念並非孤立存在,而是一條完整的能力進化鏈——從理解人類語言,到具備行動能力,再到標準化協作和專業化表現——掌握這條邏輯架構才是真正的 AI 底層基本功。

完整解析

詳細

近期 AI 圈最重要的事件是上海一所教授團隊發布了一套完整的 Agent 學習路線,這被譽為近年最具誠意的 Agent 入門教程。相比市面上 99% 的教程,這套路線具有極強的實戰性,只要不是三分鐘熱度,一個月時間就能讓完全新手進階成 AI 工程師。整個學習路線分四個階段:第一階段打基礎,掌握 AI Agent 的核心理論和四大組件(大語言模型、規劃模塊、記憶模塊、工具級);第二階段專攻 Agent 工作原理與難點解決方案,並學習 ReAct 等經典 Agent 範式;第三階段進階多智能體協作邏輯和 Prompt 調優技巧;第四階段實戰完成具體項目,將理論落實到實際業務中。

但學習 Agent 之前,必須先理解 AI 領域最容易被誤解的 8 個核心概念。首先是大語言模型(LLM),很多初學者誤以為它是更聰明的搜尋引擎,會從數據庫裡查答案。實際上大模型的工作方式是「接龍」——接收一段文本,預測下一個最可能出現的詞,再用這個詞預測下一個,一個接一個。本質上它是概率生成器,不是知識庫。這解釋了兩件事:為什麼它會「幻覺」(因為目標是讓句子聽起來合理,不是保證事實正確),以及為什麼它有創造力(正因這種創造性的預測機制才能寫詩、編故事、生成從未見過的代碼)。

接著是 Token——AI 處理文本的最小單位。很多人以為 token 就是一個字或一個詞,但實際上英文「Hello World」是兩個 token,而中文「人工智能」四個字也可能拆成兩個 token。Token 概念最直接的實用價值在於成本優化。有個被忽視的細節:同樣一句話,用中文表達的 token 消耗量大約是英文的 1.5-2 倍。在生產環境中大量調用 AI 時,把提示詞改寫成英文,成本可直接節省 50%。

隨之而來的是 Context Window(上下文窗口),它決定 AI 一次能看多少文字。很多人發現 AI 經常忘記前面說過的話,以為是 bug 或 AI 失憶,實際上 context window 就像是 AI 的辦公桌——所有指令、對話歷史和資料都鋪在這張桌子上,桌子有多大,AI 一次就能看多少。關鍵認知是:AI 沒有任何真正的記憶,每次回覆都從零起點開始,完全依靠 context 裡現有的內容去理解處境。往 context 裡塞什麼直接決定表現上限。

為了充分利用 context,我們需要 Prompt(提示詞),本質是用自然語言給 AI 編程。比較很直觀:只說「幫我寫個登入頁面」是糟糕的指令,AI 拿不到約束條件只能猜;但如果說「你是高級前端工程師,請實現一個登入頁面,包括註冊、郵箱驗證、密碼輸入框自動驗證,用什麼設計風格」,角色、需求、細節、樣式全說清楚,AI 就能直接輸出高質量代碼。Prompt 的本質就是把腦子裡模糊的想法翻譯成 AI 能精準理解的結構化指令。

但光有好指令還不夠,因為 AI 只能說不能做。這時就需要 Tool(工具)——給 AI 裝上手腳。沒工具時,AI 只能吐出文字模板讓你自己複製貼上;接入郵件工具後,AI 能直接調用發郵件接口幫你發送。AI 從參謀變成執行者,這是工具帶來的質變。

但有工具還不等於有 Agent。Agent 的區別在於決策權。沒有 Agent 的 AI 充其量是聽話的工具人——你說查數據它查,說做成圖表它做,每一步都需要你抽鞭子。有 Agent 機制後,AI 成了項目經理。比如給它一個目標「分析上月銷售情況找出問題給出建議」,Agent 就會自己思考先查數據庫、做數據清洗、生成圖表、分析趨勢、如果發現某區域業績下滑還會主動查詢原因,最後生成完整報告。整個過程中用什麼工具、遇到什麼問題、怎麼調整方案全由它決定。Agent 的核心不是手裡有多少工具,而是具備了自主決策能力。

有了 Agent 和 Tool,技術人員很快遇到新問題:連接太繁琐。連數據庫需要一套對接代碼,操作瀏覽器又要重新寫一套,每個工具的介入方式都不一樣,開發者只能不斷重複造輪子。MCP(Model Context Protocol,模型上下文協議)解決了這個問題——制定統一標準,就像電腦的 USB 接口一樣,不管是鍵盤還是 U 盤只要符合標準插上就能用,不需要為每個設備改電腦主板。MCP 就是 AI 接的通用接口,工具開發者按標準暴露能力,任何支持 MCP 的 AI 都能直接調用,省去大量中間適配工作。

最後是 Skill。AI 能思考、有工具、接口統一,似乎很完美了,但還有痛點:什麼都能做但什麼都做不太精。這就像全科醫生能看感冒但做不了心臟手術。Skill 把 Agent 從全科醫生變成專科專家,把複雜專業流程(如代碼審查、自動化測試)打包成可複用的技能包,包含專屬系統提示、固定工作流、配套工具和質量標準。通用 Agent 做特定任務可能只達 60 分,加載 Skill 後就能到 80-90 分。簡言之,Agent 給了 AI 自主決策的腦子,Skill 給了它在特定領域紮根的專業度。

這 8 個概念看似獨立,實際上是一條非常清晰的能力進化鏈:LLM、Token、Context、Prompt 解決「AI 能否聽懂人話」的問題;Tool、Agent 解決「AI 能否幹活、能否自主決策」的問題;MCP、Skill 解決「AI 能否標準化、能否像專家一樣幹活」的問題。掌握這條邏輯後,不管市場上後來吵作什麼新詞,本質都無非是讓 AI 聽得更明白、跑得更順暢、在某件事上坐得更專一。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。