KeyFrame內部研究專用

大语言模型是如何工作的 | LLM | Transformer | 注意力机制 | 位置编码 | 多头注意力 | 前馈网络 | 残差连接 | MoE | RoPE | 人工智能

Best Partners TV·7月24日週五·25 min中文

三句話摘要

大語言模型的完整工作流程:從文字輸入到逐詞預測的機制拆解。 大語言模型並無神秘,只是工程部件層層堆疊,每個部件通過五年迭代逐漸收斂到最優選擇。 分詞策略影響計算效率與泛化:分詞器選擇決定token數量和跨語言覆蓋能力;不同模型族用不同分詞器(GPT系列用BPE變種,Llama用SentencePiece),同樣句子分成更少token意味著更少計算成本。

重點整理

重點
  • 1

    分詞策略影響計算效率與泛化:分詞器選擇決定token數量和跨語言覆蓋能力;不同模型族用不同分詞器(GPT系列用BPE變種,Llama用SentencePiece),同樣句子分成更少token意味著更少計算成本。

  • 2

    嵌入空間自然涌現語義幾何結構:Token嵌入是模型學到的內部表示,意義相近的token在空間中相鄰(如「國王」靠近「女王」),這種幾何關係完全由訓練自發產生,甚至可對向量做算術運算。

  • 3

    注意力機制通過QKV三角色交換信息:每個token扮演Query(找什麼)、Key(提供什麼)、Value(傳遞何物)三角色,相似度打分後加權求和;多頭注意力並行處理不同語言關係(語法一致、代詞指代、長程引用等)。

  • 4

    前饋網絡存儲知識而非注意力:大部分模型參數集中在FFN而非注意力,FFN內某些神經元與特定概念/事實強關聯(如某神經元對「巴黎」激活),知識存儲在權重中,甚至可不重訓直接編輯。

實用技巧與重點

乾貨
  • 詞表規模:現代大模型詞表通常幾萬到幾十萬條目
  • 隱藏維度:70億參數級模型多用4096維
  • 位置編碼:主流模型(Llama、Mistral、Gemma)採用RoPE旋轉位置編碼(蘇建林2021年提出)
  • 多頭注意力細節:32個頭並非切割4096維為128維片段,而是各有學習式投影矩陣映射到各自QKV空間
  • KV緩存優化:分組查詢注意力(GQA)——多組查詢頭共享同套K/V頭(如Llama 70B為64:8、Mistral 7B為32:8比例)
  • 前饋網絡激活函數演進:原始Transformer用ReLU → GPT用GELU → 現代用SwiGLU
  • 層歸一化變化:原始用Post-Norm(層後) → 現代用Pre-Norm(層前) → 簡化版RMSNorm移除均值平移
  • 現代架構收斂方案(2023-2025):Pre-Norm規一化 + RMSNorm + RoPE + SwiGLU激活 + GQA + MoE
  • MoE參數量:Mixtral 8×7B總參數467億,但每token僅激活129億
  • 解碼參數:Temperature調整分布尖銳度、TopK/TopP限制候選token
  • 推理優化:投機解碼(Speculative Decoding)用小模型猜測,大模型驗證

結論

結論

大語言模型並無神秘,只是工程部件層層堆疊,每個部件通過五年迭代逐漸收斂到最優選擇。

完整解析

詳細

現代大語言模型的內部工作流程可完整拆解為十數個具體部件,每個部件解決一個工程問題。當你輸入文字時,模型首先不直接讀文本,而是通過分詞器將「今天天氣怎麼樣」轉換為整數序列——這是效率與泛化的折衷方案。分詞器的選擇不是細節:它決定了計算量(序列長度)和多語言覆蓋能力。之後,這些整數在嵌入查表中映射為高維向量(通常4096維),這就是模型真正操作的東西。有趣的是,嵌入空間自然涌現出語義幾何——「國王」向量靠近「女王」,「巴黎」靠近「法國」——完全是訓練過程自發形成的。

但嵌入有個致命缺陷:完全不編碼位置信息。「狗咬人」和「人咬狗」的「狗」字得到完全相同向量,這顯然無法接受。RoPE旋轉位置編碼解決了這問題——不在嵌入中加位置信息,而是根據位置旋轉Query和Key向量,使得注意力計算時真正起作用的是旋轉角度差值,自然編碼了相對位置。

接著進入架構核心:注意力機制。每個token同時扮演三角色——Query(我在找什麼)、Key(我能提供什麼)、Value(真正被傳遞的信息)。Query與所有可見的Key做相似度打分,經softmax轉為權重,再對Value加權求和。以「那只我昨天看到的貓正在睡覺」為例,處理「睡」字時,其Query會與「貓」的Key匹配度最高,所以「貓」的Value主導了新表示。多頭注意力並行運行,每個頭有獨立投影矩陣(不是簡單切割),自然分工處理不同語言現象——有頭追踪語法一致、有頭處理代詞指代、有頭識別「A-B-A」模式然後預測B重現(這就是歸納頭,也是上下文學習的可解釋機制)。

在這之後,前饋網絡獨立處理每個token,結構簡單卻參數眾多:將嵌入擴張到更大維度,經過非線性激活(現代多用SwiGLU),再壓縮回原尺寸。這裡隱藏著驚人的事實——模型的大部分參數存在FFN而非注意力,且FFN內部存儲了知識本身:特定神經元與「巴黎」「鐵塔」等概念或事實強關聯,你甚至可以不重訓模型直接編輯這些權重(ROME方法)來改變生成的內容。

支撐這一切的兩個無名英雄是殘差連接和層歸一化。殘差連接讓每層輸出加到原輸入而非替換,形成「高速公路」——淺層信息可直達深層,深層梯度也能回傳。層歸一化(現代用Pre-Norm + RMSNorm)在層間拉回數值到穩定範圍,否則十數層加法後數值必然爆炸或消失。沒有這兩個部件,幾十層的模型根本無法訓練。

生成時,模型循環預測下一個token:對最後token的最終向量用線性層映射為詞表大小的logits,經softmax轉為概率分布,由Temperature等參數控制多樣性(溫度高則分布平坦更有創意,低則尖銳更確定),再追加到輸入末尾重複。整段回答就是這個循環一次一詞跑出來的。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。