大语言模型是如何工作的 | LLM | Transformer | 注意力机制 | 位置编码 | 多头注意力 | 前馈网络 | 残差连接 | MoE | RoPE | 人工智能
三句話摘要
大語言模型的完整工作流程:從文字輸入到逐詞預測的機制拆解。 大語言模型並無神秘,只是工程部件層層堆疊,每個部件通過五年迭代逐漸收斂到最優選擇。 分詞策略影響計算效率與泛化:分詞器選擇決定token數量和跨語言覆蓋能力;不同模型族用不同分詞器(GPT系列用BPE變種,Llama用SentencePiece),同樣句子分成更少token意味著更少計算成本。
重點整理
重點- 1
分詞策略影響計算效率與泛化:分詞器選擇決定token數量和跨語言覆蓋能力;不同模型族用不同分詞器(GPT系列用BPE變種,Llama用SentencePiece),同樣句子分成更少token意味著更少計算成本。
- 2
嵌入空間自然涌現語義幾何結構:Token嵌入是模型學到的內部表示,意義相近的token在空間中相鄰(如「國王」靠近「女王」),這種幾何關係完全由訓練自發產生,甚至可對向量做算術運算。
- 3
注意力機制通過QKV三角色交換信息:每個token扮演Query(找什麼)、Key(提供什麼)、Value(傳遞何物)三角色,相似度打分後加權求和;多頭注意力並行處理不同語言關係(語法一致、代詞指代、長程引用等)。
- 4
前饋網絡存儲知識而非注意力:大部分模型參數集中在FFN而非注意力,FFN內某些神經元與特定概念/事實強關聯(如某神經元對「巴黎」激活),知識存儲在權重中,甚至可不重訓直接編輯。
實用技巧與重點
乾貨- 詞表規模:現代大模型詞表通常幾萬到幾十萬條目
- 隱藏維度:70億參數級模型多用4096維
- 位置編碼:主流模型(Llama、Mistral、Gemma)採用RoPE旋轉位置編碼(蘇建林2021年提出)
- 多頭注意力細節:32個頭並非切割4096維為128維片段,而是各有學習式投影矩陣映射到各自QKV空間
- KV緩存優化:分組查詢注意力(GQA)——多組查詢頭共享同套K/V頭(如Llama 70B為64:8、Mistral 7B為32:8比例)
- 前饋網絡激活函數演進:原始Transformer用ReLU → GPT用GELU → 現代用SwiGLU
- 層歸一化變化:原始用Post-Norm(層後) → 現代用Pre-Norm(層前) → 簡化版RMSNorm移除均值平移
- 現代架構收斂方案(2023-2025):Pre-Norm規一化 + RMSNorm + RoPE + SwiGLU激活 + GQA + MoE
- MoE參數量:Mixtral 8×7B總參數467億,但每token僅激活129億
- 解碼參數:Temperature調整分布尖銳度、TopK/TopP限制候選token
- 推理優化:投機解碼(Speculative Decoding)用小模型猜測,大模型驗證
結論
結論“大語言模型並無神秘,只是工程部件層層堆疊,每個部件通過五年迭代逐漸收斂到最優選擇。”
完整解析
詳細現代大語言模型的內部工作流程可完整拆解為十數個具體部件,每個部件解決一個工程問題。當你輸入文字時,模型首先不直接讀文本,而是通過分詞器將「今天天氣怎麼樣」轉換為整數序列——這是效率與泛化的折衷方案。分詞器的選擇不是細節:它決定了計算量(序列長度)和多語言覆蓋能力。之後,這些整數在嵌入查表中映射為高維向量(通常4096維),這就是模型真正操作的東西。有趣的是,嵌入空間自然涌現出語義幾何——「國王」向量靠近「女王」,「巴黎」靠近「法國」——完全是訓練過程自發形成的。
但嵌入有個致命缺陷:完全不編碼位置信息。「狗咬人」和「人咬狗」的「狗」字得到完全相同向量,這顯然無法接受。RoPE旋轉位置編碼解決了這問題——不在嵌入中加位置信息,而是根據位置旋轉Query和Key向量,使得注意力計算時真正起作用的是旋轉角度差值,自然編碼了相對位置。
接著進入架構核心:注意力機制。每個token同時扮演三角色——Query(我在找什麼)、Key(我能提供什麼)、Value(真正被傳遞的信息)。Query與所有可見的Key做相似度打分,經softmax轉為權重,再對Value加權求和。以「那只我昨天看到的貓正在睡覺」為例,處理「睡」字時,其Query會與「貓」的Key匹配度最高,所以「貓」的Value主導了新表示。多頭注意力並行運行,每個頭有獨立投影矩陣(不是簡單切割),自然分工處理不同語言現象——有頭追踪語法一致、有頭處理代詞指代、有頭識別「A-B-A」模式然後預測B重現(這就是歸納頭,也是上下文學習的可解釋機制)。
在這之後,前饋網絡獨立處理每個token,結構簡單卻參數眾多:將嵌入擴張到更大維度,經過非線性激活(現代多用SwiGLU),再壓縮回原尺寸。這裡隱藏著驚人的事實——模型的大部分參數存在FFN而非注意力,且FFN內部存儲了知識本身:特定神經元與「巴黎」「鐵塔」等概念或事實強關聯,你甚至可以不重訓模型直接編輯這些權重(ROME方法)來改變生成的內容。
支撐這一切的兩個無名英雄是殘差連接和層歸一化。殘差連接讓每層輸出加到原輸入而非替換,形成「高速公路」——淺層信息可直達深層,深層梯度也能回傳。層歸一化(現代用Pre-Norm + RMSNorm)在層間拉回數值到穩定範圍,否則十數層加法後數值必然爆炸或消失。沒有這兩個部件,幾十層的模型根本無法訓練。
生成時,模型循環預測下一個token:對最後token的最終向量用線性層映射為詞表大小的logits,經softmax轉為概率分布,由Temperature等參數控制多樣性(溫度高則分布平坦更有創意,低則尖銳更確定),再追加到輸入末尾重複。整段回答就是這個循環一次一詞跑出來的。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


