KeyFrame內部研究專用

Claude 被开源了?Qwythos-9B 突然发布!无审查、104万上下文、4GB 显存可跑!附本地部署 | 零度解说

零度解说·6月24日週三·10 min中文

三句話摘要

Qwen 9B 開源模型的本地部署與功能測試——一個吸收 Claude 推理能力、支持百萬 Token 上下文、4G 顯存可運行的無審查 AI 模型。 Qwen 9B 通過吸收 Claude 推理能力,在 9B 參數、4G 顯存的限制下實現了接近大模型的表現,是本地 AI 部署從玩具到實用工具的關鍵轉折點。 推理能力遷移:模型利用 Empathy AR 內部的 Reasoning 系統深層思維數據訓練,將 Claude 的推理方式直接遷移到 9B 小模型,實現了參數量和能力的非線性優化。

重點整理

重點
  • 1

    推理能力遷移:模型利用 Empathy AR 內部的 Reasoning 系統深層思維數據訓練,將 Claude 的推理方式直接遷移到 9B 小模型,實現了參數量和能力的非線性優化。

  • 2

    硬體友善:四個量化版本對應不同顯存需求(4G/6G/8G/16G),用戶可根據現有硬體選擇,官方已發布 GGUF 格式,最低 4G 顯存即可本地運行無需付費 API。

  • 3

    無審查特性:與 Claude 等商業模型不同,該模型對敏感內容無限制,實測可生成壓力測試工具代碼,體現開源模型的自由度。

  • 4

    工程實用性:支持原生 Function Calling、工具調用、錯誤糾正,同時內置視覺模型,可同時處理文本、圖像、3D 場景理解,適合複雜工程應用。

實用技巧與重點

乾貨
  • 模型規格:
  • 名稱:Qwen 9B
  • 基礎:13.5B 模型優化版
  • 上下文:100 萬 Token
  • 特性:無審查、Function Calling、工具調用、視覺模型內置
  • 量化版本與顯存對應:
  • BF16:18G(16G+ 顯卡適用)
  • Q8:9G(8G 顯卡適用)
  • Q6:7G(6G 顯卡適用)
  • Q4:5G(4G 顯卡適用)
  • 所需工具:
  • 下載源:Hugging Face 或官方打包
  • 加載框架:NumberCVP 科學項目(提供 Windows/MacOS/Android 版本,支援 Nvidia/AMD/Intel GPU)
  • 視覺模型:MMProj 開頭,900+ MB,分 f16(文本+圖像)和大寫 F16(純文本)兩個版本
  • 部署步驟:
  • 建立文件夾結構(Motos 文件夾)
  • 下載主模型和視覺模型到 Motos 文件夾
  • 下載 NumberCVP 框架並解壓
  • 獲取啟動指令碼(BAT 格式)
  • 根據顯存選擇量化版本執行啟動
  • 訪問本地地址 127.0.0.1:8080
  • 實測性能:
  • Q8 版本生成速度:約 75 tokens/秒
  • 代碼生成:3D 賽車遊戲(支援方向鍵、加速、刹車、觸控)、壓力測試工具、網頁總結程式可一步到位生成
  • 多模態:支持圖片識別、3D 場景理解

結論

結論

Qwen 9B 通過吸收 Claude 推理能力,在 9B 參數、4G 顯存的限制下實現了接近大模型的表現,是本地 AI 部署從玩具到實用工具的關鍵轉折點。

完整解析

詳細

Qwen 9B 是一個在開源模型中相當罕見的存在。它的核心創新在於推理能力遷移——開發者並非簡單地縮小一個大模型,而是利用 Empathy AR 內部的深層思維訓練系統,蒐集了超過 5 萬條來自 Claude MeSauce 和 Fable 5 的高質量推理軌跡,將這些推理邏輯直接注入一個 13.5B 的基礎模型中。這等於是把商業最強模型的思維方式用知識蒸餾的方式「移植」到了開源領域,結果是一個 9B 大小卻擁有遠超預期推理能力的模型。

從硬體可及性來看,這個模型設計得相當親民。官方提供了四個量化版本,從 BF16 的 18GB 到 Q4 的 5GB,覆蓋了 4GB 到 16GB 顯卡的所有常見場景。這意味著普通使用者不再被迫依賴商業雲端 API,可以在本地電腦上完全私密地運行推理。部署流程也經過優化——只需下載模型、裝好 NumberCVP 框架、執行啟動指令碼,就能在 127.0.0.1:8080 本地訪問,整個過程不超過 15 分鐘。

在功能測試中,這個模型展現出令人意外的多能性。代碼生成方面,它可以一次性生成具有完整功能的程序,比如支援方向鍵控制、加速、刹車、碰撞檢測、觸控操作的 3D 賽車遊戲,代碼結構清晰且確實可運行。更值得注意的是它對敏感內容的處理——實測發現它會直接生成壓力測試工具代碼(TCP/UDP 協議),這恰好展現了開源無審查模型相對於商業模型的自由度。此外,模型內置視覺模型,可以同時理解文字指令和圖像輸入,生成網頁內容總結程式或識別 3D 場景的能力都沒問題。Q8 量化版本的生成速度約為每秒 75 個 token,對於一個本地運行的 9B 模型而言已是相當實用的水準。

整體而言,Qwen 9B 代表了開源模型在「小參數量卻保留強能力」這個方向上的突破。它不是單純的功能閹割版,而是通過推理能力遷移真正實現了參數量和輸出質量的優化平衡,同時保持完全本地化運行和無審查的特性,為需要私密運算或離線環境的開發者打開了新的可能。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。