Qwen 3.8 27B vs DeepSeek V4 Flash — I Built the Same Apps With Both Locally
三句話摘要
Qwen 3.8 27B 與 DeepSeek V4 Flash 編碼能力實測對比。 Qwen 3.8 27B 在編碼實用性與問題修復能力上明顯優於 DeepSeek V4 Flash,特別是困難任務中能首輪產出完全可用的系統,開發者應優先採用。 測試場景設計完整且遞進式:從 API 整合(天氣儀表板)→ 互動遊戲邏輯(塔防)→ 動態公式系統(試算表),三個難度層級充分暴露模型的編碼深度與問題解決能力差異。
重點整理
重點- 1
測試場景設計完整且遞進式:從 API 整合(天氣儀表板)→ 互動遊戲邏輯(塔防)→ 動態公式系統(試算表),三個難度層級充分暴露模型的編碼深度與問題解決能力差異。
- 2
Qwen 在細節 UX 與需求理解上更優:天氣儀表板主動提供多城市選項而非單一預設,新增經緯度顯示,這反映出對使用者意圖的更細緻解讀,而非僅止於功能堆砌。
- 3
困難任務揭露核心差異在於除錯能力:Qwen 遇到覆蓋層問題時,透過再提示描述症狀(而非直接指點程式碼)能逐步修正;DeepSeek 則長期困在鍵盤輸入函數不完整或缺少關鍵程式碼行,多輪重新提示後仍未改善。
- 4
推理模式的差異化效果:關閉推理時雙方都失敗;啟用思考模式設低推理努力後,Qwen 首輪即產出完全可用系統,DeepSeek 仍無法正常儲存値,顯示 Qwen 在有限推理預算下的效率更高且更穩定。
實用技巧與重點
乾貨- 模型版本:Qwen 3.8 27B、DeepSeek V4 Flash
- 執行環境:Mac Studio、Poe.dev Agent Harness
- 測試任務規格:
- 天氣儀表板:單一 HTML 檔案、城市搜尋功能、當前溫度、體感溫度、濕度、7 天預報、24 小時預報、經緯度座標
- 塔防遊戲:Canvas 放置系統、Archer/Cannon 塔、最多升級 3 次、出售退款 70%、波次系統、射程圓圈視覺
- 試算表:可點選儲存格、直接數值輸入、公式支援(A1+B2、AVERAGE())、錯誤處理(除以零、無效公式)
- 提示工程方法:單輪測試 vs 多輪症狀描述(故意不直接指點程式碼行)
- 推理配置對比:
- 無推理模式:雙方首輪都失敗
- 推理開啟 + Low reasoning effort:Qwen 成功,DeepSeek 失敗
- 常見故障:
- Qwen:覆蓋層阻擋點擊事件(邏輯完好但被遮蔽)、儲存格鎖定問題
- DeepSeek:缺少單字元(如分號)或完整行程式碼、鍵盤輸入函數不完整、無法持久化儲存格值
結論
結論“Qwen 3.8 27B 在編碼實用性與問題修復能力上明顯優於 DeepSeek V4 Flash,特別是困難任務中能首輪產出完全可用的系統,開發者應優先採用。”
完整解析
詳細這次評測針對兩個輕量級模型的實務編碼表現進行系統性比較。講者在 Mac Studio 上運行 Qwen 3.8 27B 與 DeepSeek V4 Flash,於 Poe.dev 代理環境中執行三個難度遞增的編碼任務。所有輸出均限制為自包含 HTML 檔案,禁用外部依賴或多檔案架構,模擬現實開發環境中對模型自主完成能力的考驗。
天氣儀表板是最初級測試。Qwen 版本展現更優的使用者體驗:搜尋「Melbourne」時呈現澳洲與美國兩個選項供使用者選擇,並主動顯示經緯度座標。這些細節不在原始提示中明確要求,卻體現了模型對常見使用者需求的預判。相比之下,DeepSeek 版本默認澳洲墨爾本,無選項機制,且天氣圖示部分無法渲染。兩版本都正確實現了溫度、濕度、7 天預報與 24 小時預報等核心功能,但 Qwen 的版面佈局與互動流程明顯更直觀。
塔防遊戲進入中等難度。講者特別強調:給 27B 級模型一個「建塔防遊戲」的模糊指令時,它們通常會遺漏某些關鍵功能(如無法拖放、無法射擊敵人)。為避免此問題,講者在提示中明確描述了棋盤大小、塔的種類(Archer、Cannon)、敵人行為、升級機制(3 次升級、70% 出售價格)等細節。兩個模型都成功實現了所有功能。Qwen 版本要求先點擊塔再點擊棋盤位置放置,UI 按鈕會因文字變化而位移,覆蓋遊戲畫面。DeepSeek 版本則提供更清晰的使用者引導(「選擇塔,然後點擊草地儲存格」),並在放置時即時顯示射程圓圈,版面居中且乾淨。Qwen 版本的路徑視覺有細微差異,但整體功能對等,講者評為五五開。
試算表測試才是真正考驗模型的任務。首輪沒有推理的結果中,Qwen 無法響應點擊事件(原因是程式碼在整個畫布上放置了一個看不見的覆蓋層),而 DeepSeek 可以點擊但無法輸入或儲存值。講者隨後多輪重新提示,每輪只描述症狀(「我無法點擊儲存格」或「我無法輸入值」)而非直接修改程式碼。Qwen 在第三輪時部分突破了覆蓋層問題,但仍無法完全運作所有儲存格。DeepSeek 經歷相同的多輪迭代後,仍然無法讓使用者輸入任何值。檢查源碼後發現 DeepSeek 缺少了鍵盤輸入事件處理函數或單個關鍵字元,導致整個輸入系統崩潰。
轉折發生在新對話中啟用推理模式的測試。講者在新的 Poe.dev 環境中同時開啟思考模式與設定推理努力為「低」。在這個配置下,Qwen 首輪即產生完全可用的試算表:使用者可以點擊任何儲存格輸入數值(如「10」),系統正確儲存;可以撰寫公式(A1*B1 = 580、AVERAGE(A1:B1) = 34),計算結果準確顯示。唯一小缺陷是某些儲存格的選擇狀態會黏著,按 Escape 可清除。DeepSeek 在相同推理配置下仍舊失敗:點擊與輸入都存在問題,即使輸入文字似乎有反應,最終也無法持久化到儲存格。DeepSeek 版本的 UI 在邊界對齊上更像 Google Sheets(貼邊設計),是唯一的優點。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


