KeyFrame內部研究專用

Qwen 3.6 27B Fable Fusion 711 tested vs Base Qwen 27B - 16GB Local LLM setup

Luke's Dev Lab·7月29日週三·37 min英文

三句話摘要

對比測試開源模型 Fable Fusion 7-1-1 與 Qwen 3.6 27B 在性能、記憶、編碼與 MCP 工具集成上的差異與各自優勢。 Fable Fusion 7-1-1 在基礎性能與記憶上與 Qwen 相當,但在創意任務與 MCP 工具集成中展現更好的適應性,兩者各具場景優勢,選擇應依據工作類型而定。 性能基礎相同,差異在應用層

重點整理

重點
  • 1

    性能基礎相同,差異在應用層

  • 2

    Fable Fusion 與 Qwen 在預填充與解碼速度上完全相近(預填充 66-67 token/s、解碼 4.2-4.6 token/s),兩者都在測試系統上表現緩慢,但差異主要體現在應用層的適應性與輸出品質,而非原始推理能力。

  • 3

    長上下文記憶測試反映輸出品質差異

  • 4

    兩模型在 256K 上下文中均達成 100% 的資料尋找成功率,但 Fable Fusion 的回應格式更整潔一致,而 Qwen 有時將關鍵資訊埋沒於冗長雜亂的輸出中,顯示兩者的思維清晰度存在差異。

  • 5

    編碼任務呈現明顯的速度與穩定性權衡

  • 6

    Qwen 在 Kanban 應用、物理模擬與地牢演算法上更快更穩定,功能完整度較高;Fable Fusion 用時更長,需要更多修正迴圈,但在複雜編碼推理上效率更高(OpenAI Human Eval 通過率 73% vs 62%)。

  • 7

    Fable Fusion 在創意與工具集成中明顯領先

  • 8

    Blender 建模中 Fable Fusion 生成的資產視覺品質更精緻;Godot 遊戲開發中成功實現完整可玩遊戲(移動、跳躍、衝刺機制),而 Qwen 版本出現控制綁定失效,無法正常互動。

實用技巧與重點

乾貨
  • 測試配置:
  • 模型:Qwen 3.6 27B、Fable Fusion 7-1-1(4-bit IQ4_NL GGUF)
  • 硬體:16GB VRAM + 32GB 系統記憶體
  • 執行環境:llama.cpp
  • 性能數據:
  • 預填充速度:32K 上下文時 66.3-67.6 token/s
  • 解碼速度:4.2-4.6 token/s
  • 長上下文:256K 內存注入深度測試(0-100% 深度,各 3 次,共 15 次運行)
  • 代理任務測試結果:
  • Agency Benchmark:兩模型 98% 通過率,各失敗 1 題(currency conversion,未按指令調用工具)
  • OpenAI Human Eval(164 編碼題):Fable Fusion 73%、Qwen 62%;Fable Fusion 無法回答 34 題、Qwen 54 題
  • 編碼任務結果:
  • Kanban 應用:Qwen 優(功能完整,狀態管理修復後穩定);Fable Fusion 需多次修復,拖拽最終失效
  • 沙粒物理:Qwen 優(30-60fps 流暢);Fable Fusion 幀率低(20-30fps)且液體物理有缺陷
  • 地牢爬蟲:Qwen 用時 45%、Fable Fusion 34%,品質相當
  • MCP 與 3D 工具:
  • Blender 建模:Fable Fusion 資產更精緻
  • Godot 平台遊戲:Fable Fusion 實現完整可玩遊戲;Qwen 控制無法運作
  • 外部資源:
  • GitHub 連結:所有提示語、測試程式碼、模型配置已上傳
  • 贊助商:Flute MCP(支援本地開源模型或付費 API,零成本選項)

結論

結論

Fable Fusion 7-1-1 在基礎性能與記憶上與 Qwen 相當,但在創意任務與 MCP 工具集成中展現更好的適應性,兩者各具場景優勢,選擇應依據工作類型而定。

完整解析

詳細

Luke 這場測評對比了兩個 27B 參數開源模型在相同硬體上的表現。系統配置為 16GB VRAM 與 32GB 系統記憶體,執行環境採用 llama.cpp 的 4-bit 量化版本。

基礎性能層面,兩模型幾乎不分軒輊。預填充速度(模型讀取上下文的速度)在小規模提示時都是 88 token/s,隨著上下文增長至 32K 時降至 66-67 token/s;解碼速度(生成新 token 的速度)更是接近一致,都在 4.2-4.6 token/s 之間。這表明在純推理速度上兩模型差異有限,主要區別來自於應用層的適應性與思維清晰度。

長上下文記憶測試反映了兩模型在處理 256K 上下文時的穩定性。Luke 將資料注入到上下文的不同深度(0%-100%),讓模型找出隱藏的資訊。兩模型都達成了 100% 的成功率,顯示均有優秀的上下文追蹤能力。然而,輸出品質呈現差異——Fable Fusion 的回應格式整潔一致,而 Qwen 有時會將關鍵資訊混雜於冗長的輸出中。在代理任務測試中,兩模型都達成 98% 的通過率,唯一失敗點是 currency conversion 題目,都選擇自行計算而非調用官方工具。

OpenAI Human Eval 測試涵蓋 164 道編碼題,Fable Fusion 表現略勝,通過率達 73%,相比 Qwen 的 62%。關鍵區別在於 Qwen 無法回答 54 道題目,而 Fable Fusion 只有 34 道,顯示 Fable Fusion 在複雜推理上的「思維預算」消耗更有效率。

編碼實戰中出現明顯分化。Kanban 應用(前端開發)測試中,Qwen 交付的功能更完整,儘管需要修復;Fable Fusion 的實現雖視覺精美但功能缺陷更多。沙粒物理模擬展現類似的模式——Qwen 性能更流暢(30-60fps),Fable Fusion 幀率下跌(20-30fps)且液體物理有缺陷。地牢爬蟲遊戲則顯示 Qwen 用時較長(45% 上下文),但實現品質相當。

MCP 工具集成則是 Fable Fusion 的強項。Blender 資產建模中,Fable Fusion 生成的大理石與門框視覺品質更精緻。更顯著的是 Godot 遊戲開發——簡化的 3D 平台遊戲中,Fable Fusion 成功實現完整可玩遊戲(包含移動、跳躍、衝刺機制),而 Qwen 版本出現控制綁定問題導致無法移動。雖然 Fable Fusion 耗時頗長,但最終交付的玩法更完整。整體而言,兩模型適用於不同場景:純粹的網頁開發與演算法任務上 Qwen 更快更穩定;涉及創意設計、3D 建模或 MCP 工具鏈的工作則 Fable Fusion 優勢更明顯。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。