Qwen 3.6 27B Fable Fusion 711 tested vs Base Qwen 27B - 16GB Local LLM setup
三句話摘要
對比測試開源模型 Fable Fusion 7-1-1 與 Qwen 3.6 27B 在性能、記憶、編碼與 MCP 工具集成上的差異與各自優勢。 Fable Fusion 7-1-1 在基礎性能與記憶上與 Qwen 相當,但在創意任務與 MCP 工具集成中展現更好的適應性,兩者各具場景優勢,選擇應依據工作類型而定。 性能基礎相同,差異在應用層
重點整理
重點- 1
性能基礎相同,差異在應用層
- 2
Fable Fusion 與 Qwen 在預填充與解碼速度上完全相近(預填充 66-67 token/s、解碼 4.2-4.6 token/s),兩者都在測試系統上表現緩慢,但差異主要體現在應用層的適應性與輸出品質,而非原始推理能力。
- 3
長上下文記憶測試反映輸出品質差異
- 4
兩模型在 256K 上下文中均達成 100% 的資料尋找成功率,但 Fable Fusion 的回應格式更整潔一致,而 Qwen 有時將關鍵資訊埋沒於冗長雜亂的輸出中,顯示兩者的思維清晰度存在差異。
- 5
編碼任務呈現明顯的速度與穩定性權衡
- 6
Qwen 在 Kanban 應用、物理模擬與地牢演算法上更快更穩定,功能完整度較高;Fable Fusion 用時更長,需要更多修正迴圈,但在複雜編碼推理上效率更高(OpenAI Human Eval 通過率 73% vs 62%)。
- 7
Fable Fusion 在創意與工具集成中明顯領先
- 8
Blender 建模中 Fable Fusion 生成的資產視覺品質更精緻;Godot 遊戲開發中成功實現完整可玩遊戲(移動、跳躍、衝刺機制),而 Qwen 版本出現控制綁定失效,無法正常互動。
實用技巧與重點
乾貨- 測試配置:
- 模型:Qwen 3.6 27B、Fable Fusion 7-1-1(4-bit IQ4_NL GGUF)
- 硬體:16GB VRAM + 32GB 系統記憶體
- 執行環境:llama.cpp
- 性能數據:
- 預填充速度:32K 上下文時 66.3-67.6 token/s
- 解碼速度:4.2-4.6 token/s
- 長上下文:256K 內存注入深度測試(0-100% 深度,各 3 次,共 15 次運行)
- 代理任務測試結果:
- Agency Benchmark:兩模型 98% 通過率,各失敗 1 題(currency conversion,未按指令調用工具)
- OpenAI Human Eval(164 編碼題):Fable Fusion 73%、Qwen 62%;Fable Fusion 無法回答 34 題、Qwen 54 題
- 編碼任務結果:
- Kanban 應用:Qwen 優(功能完整,狀態管理修復後穩定);Fable Fusion 需多次修復,拖拽最終失效
- 沙粒物理:Qwen 優(30-60fps 流暢);Fable Fusion 幀率低(20-30fps)且液體物理有缺陷
- 地牢爬蟲:Qwen 用時 45%、Fable Fusion 34%,品質相當
- MCP 與 3D 工具:
- Blender 建模:Fable Fusion 資產更精緻
- Godot 平台遊戲:Fable Fusion 實現完整可玩遊戲;Qwen 控制無法運作
- 外部資源:
- GitHub 連結:所有提示語、測試程式碼、模型配置已上傳
- 贊助商:Flute MCP(支援本地開源模型或付費 API,零成本選項)
結論
結論“Fable Fusion 7-1-1 在基礎性能與記憶上與 Qwen 相當,但在創意任務與 MCP 工具集成中展現更好的適應性,兩者各具場景優勢,選擇應依據工作類型而定。”
完整解析
詳細Luke 這場測評對比了兩個 27B 參數開源模型在相同硬體上的表現。系統配置為 16GB VRAM 與 32GB 系統記憶體,執行環境採用 llama.cpp 的 4-bit 量化版本。
基礎性能層面,兩模型幾乎不分軒輊。預填充速度(模型讀取上下文的速度)在小規模提示時都是 88 token/s,隨著上下文增長至 32K 時降至 66-67 token/s;解碼速度(生成新 token 的速度)更是接近一致,都在 4.2-4.6 token/s 之間。這表明在純推理速度上兩模型差異有限,主要區別來自於應用層的適應性與思維清晰度。
長上下文記憶測試反映了兩模型在處理 256K 上下文時的穩定性。Luke 將資料注入到上下文的不同深度(0%-100%),讓模型找出隱藏的資訊。兩模型都達成了 100% 的成功率,顯示均有優秀的上下文追蹤能力。然而,輸出品質呈現差異——Fable Fusion 的回應格式整潔一致,而 Qwen 有時會將關鍵資訊混雜於冗長的輸出中。在代理任務測試中,兩模型都達成 98% 的通過率,唯一失敗點是 currency conversion 題目,都選擇自行計算而非調用官方工具。
OpenAI Human Eval 測試涵蓋 164 道編碼題,Fable Fusion 表現略勝,通過率達 73%,相比 Qwen 的 62%。關鍵區別在於 Qwen 無法回答 54 道題目,而 Fable Fusion 只有 34 道,顯示 Fable Fusion 在複雜推理上的「思維預算」消耗更有效率。
編碼實戰中出現明顯分化。Kanban 應用(前端開發)測試中,Qwen 交付的功能更完整,儘管需要修復;Fable Fusion 的實現雖視覺精美但功能缺陷更多。沙粒物理模擬展現類似的模式——Qwen 性能更流暢(30-60fps),Fable Fusion 幀率下跌(20-30fps)且液體物理有缺陷。地牢爬蟲遊戲則顯示 Qwen 用時較長(45% 上下文),但實現品質相當。
MCP 工具集成則是 Fable Fusion 的強項。Blender 資產建模中,Fable Fusion 生成的大理石與門框視覺品質更精緻。更顯著的是 Godot 遊戲開發——簡化的 3D 平台遊戲中,Fable Fusion 成功實現完整可玩遊戲(包含移動、跳躍、衝刺機制),而 Qwen 版本出現控制綁定問題導致無法移動。雖然 Fable Fusion 耗時頗長,但最終交付的玩法更完整。整體而言,兩模型適用於不同場景:純粹的網頁開發與演算法任務上 Qwen 更快更穩定;涉及創意設計、3D 建模或 MCP 工具鏈的工作則 Fable Fusion 優勢更明顯。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


