KeyFrame內部研究專用

NEW Qwen Model is INSANE! 🤯

Julian Goldie SEO·6月26日週五·8 min英文

三句話摘要

NVIDIA 將阿里巴巴 Quen 3.6 模型壓縮至 1/3 體積,在單張顯卡上運行且性能幾乎不減。 過去競爭的堡壘是誰擁有最大的電腦農場;現在優勢轉向誰最先學會用這些免費、高效、開源的工具——而這個窗口還很新,大多數人仍在觀望。 稀疏混合專家架構打破大即優勢的迷思

重點整理

重點
  • 1

    稀疏混合專家架構打破大即優勢的迷思

  • 2

    模型看似擁有 35 億參數,實則採用稀疏激活設計,每次只運行其中 3 億(A3B),其餘 247 個專家待命。這猶如醫院只需要特定科室醫生而非全部員工對單個患者看診,既保留大模型的智力,又獲得小模型的速度和成本效益。

  • 3

    量化技術實現真正的民主化部署

  • 4

    NVIDIA 的 NVF-P4 量化將每個數字儲存空間縮小至原來的 1/4,整個模型體積縮減 2/3,卻幾乎不損失性能。側邊測試顯示評分浮動極小,實質上以三分之一的資源成本換取完整智能——從 GPU 農場獨占轉向單卡個人可運行。

  • 5

    長上下文與推理能力支撐實際業務應用

  • 6

    262,000 字的上下文窗口使模型能一次讀完整本書或企業的所有文檔,保持對話連貫性。加上 73.4 的 SWE-BenchVerified 編程測試分數(超過谷歌同級別模型 21 分),足以勝任代碼修復、文檔分析與業務流程自動化。

  • 7

    開源免費模式轉移競爭焦點

  • 8

    從前「誰的電腦最大」決定了 AI 應用的勝負。如今免費、開源、可商用的高效能模型改寫局面——競爭門檻從資本密集轉向使用者對工具的理解與優化能力,為中小企業和個人開放新的機會窗口。

實用技巧與重點

乾貨
  • 模型名稱:Quen 3.635B-A3B(Quen 3.6)
  • 參數量:35B 參數,每次激活 3B
  • 架構:混合專家模型(MoE),256 個專家子模型,每次激活 9 個
  • NVIDIA 優化版本:NVF-P4 量化版
  • 體積縮減:2/3(原體積的 1/3)
  • 數字精度:從原精度縮至 1/4
  • 運行硬體:單張高端 GPU
  • 運行速度:超過 100 words per second
  • 編程測試分數:SWE-BenchVerified 73.4 分
  • 對比:擊敗 Google 同級模型 21 分
  • 上下文長度:262,000 字
  • 成本:免費開源,商用可用
  • 已知限制:可能出現重複自我驗證、工具調用需要正確配置、非插即用

結論

結論

過去競爭的堡壘是誰擁有最大的電腦農場;現在優勢轉向誰最先學會用這些免費、高效、開源的工具——而這個窗口還很新,大多數人仍在觀望。

完整解析

詳細

NVIDIA 對阿里巴巴 Quen 3.6 的優化代表了 AI 可及性的一個轉折點。傳統認知中,更大的模型意味著更強的能力,但也意味著更高的部署成本——只有擁有巨大計算資源的科技巨頭才能運營。Quen 3.6 打破了這個邏輯。模型表面上有 35 億參數,但採用稀疏混合專家(MoE)架構,內部包含 256 個專家子模型,每次處理文字時只喚醒其中 9 個,其餘 247 個保持休眠。這種設計讓模型在運行時實際消耗的計算量只相當於 3 億參數,卻保留了 35 億參數模型的知識深度——就像醫院不需要每位醫生都走進診間,只需呼叫必要的專科醫生。

NVIDIA 的進一步優化在量化層面:通過 NVF-P4 技術,他們將每個數字的存儲格式縮小至原來的 1/4,直接將模型體積削減 2/3。重點是,經過並排測試,這個壓縮版本的性能幾乎沒有差異——評分只有微妙的浮動,實質上是等效的。這意味著你現在可以用原來 1/3 的硬體、1/3 的記憶體、1/3 的成本,得到完全相同的智能輸出。一位開發者在高端單卡上達到每秒超過 100 字的運行速度,這對於個人開發者而言是過去無法想像的。

在實際能力層面,Quen 3.6 並非只是聊天模型,而是為實際工作設計的「代理」(Agent),能夠自主讀取、思考、修復和驗證。在著名的 SWE-BenchVerified 編程測試(要求模型從真實軟體專案中修復 bug)上,它得分 73.4,與全球頂級付費模型相近,並以 21 分的優勢擊敗了 Google 的同級模型。一名開發者僅給予文字描述就讓它寫出了整個小遊戲——10 個文件、3,400+ 行代碼,甚至自主發現並修正了自己的錯誤,遊戲一次就能運行。模型的 262,000 字上下文窗口讓它能一次性處理完整的長篇文檔——相當於整本書——而不會在中途遺忘前面的內容,這為企業應用開闢了新可能,例如讓模型閱讀所有往年的客戶問題後自動起草回應、或在學習企業風格後生成符合品牌調性的文案。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。