KeyFrame內部研究專用

Qwen 3.8 27B vs DeepSeek V4 Flash — I Built the Same Apps With Both Locally

Bart Slodyczka·8月16日週日·18 min英文

三句話摘要

Qwen 3.8 27B 與 DeepSeek V4 Flash 編碼能力實測對比。 Qwen 3.8 27B 在編碼實用性與問題修復能力上明顯優於 DeepSeek V4 Flash,特別是困難任務中能首輪產出完全可用的系統,開發者應優先採用。 測試場景設計完整且遞進式:從 API 整合(天氣儀表板)→ 互動遊戲邏輯(塔防)→ 動態公式系統(試算表),三個難度層級充分暴露模型的編碼深度與問題解決能力差異。

重點整理

重點
  • 1

    測試場景設計完整且遞進式:從 API 整合(天氣儀表板)→ 互動遊戲邏輯(塔防)→ 動態公式系統(試算表),三個難度層級充分暴露模型的編碼深度與問題解決能力差異。

  • 2

    Qwen 在細節 UX 與需求理解上更優:天氣儀表板主動提供多城市選項而非單一預設,新增經緯度顯示,這反映出對使用者意圖的更細緻解讀,而非僅止於功能堆砌。

  • 3

    困難任務揭露核心差異在於除錯能力:Qwen 遇到覆蓋層問題時,透過再提示描述症狀(而非直接指點程式碼)能逐步修正;DeepSeek 則長期困在鍵盤輸入函數不完整或缺少關鍵程式碼行,多輪重新提示後仍未改善。

  • 4

    推理模式的差異化效果:關閉推理時雙方都失敗;啟用思考模式設低推理努力後,Qwen 首輪即產出完全可用系統,DeepSeek 仍無法正常儲存値,顯示 Qwen 在有限推理預算下的效率更高且更穩定。

實用技巧與重點

乾貨
  • 模型版本:Qwen 3.8 27B、DeepSeek V4 Flash
  • 執行環境:Mac Studio、Poe.dev Agent Harness
  • 測試任務規格
  • 天氣儀表板:單一 HTML 檔案、城市搜尋功能、當前溫度、體感溫度、濕度、7 天預報、24 小時預報、經緯度座標
  • 塔防遊戲:Canvas 放置系統、Archer/Cannon 塔、最多升級 3 次、出售退款 70%、波次系統、射程圓圈視覺
  • 試算表:可點選儲存格、直接數值輸入、公式支援(A1+B2、AVERAGE())、錯誤處理(除以零、無效公式)
  • 提示工程方法:單輪測試 vs 多輪症狀描述(故意不直接指點程式碼行)
  • 推理配置對比
  • 無推理模式:雙方首輪都失敗
  • 推理開啟 + Low reasoning effort:Qwen 成功,DeepSeek 失敗
  • 常見故障
  • Qwen:覆蓋層阻擋點擊事件(邏輯完好但被遮蔽)、儲存格鎖定問題
  • DeepSeek:缺少單字元(如分號)或完整行程式碼、鍵盤輸入函數不完整、無法持久化儲存格值

結論

結論

Qwen 3.8 27B 在編碼實用性與問題修復能力上明顯優於 DeepSeek V4 Flash,特別是困難任務中能首輪產出完全可用的系統,開發者應優先採用。

完整解析

詳細

這次評測針對兩個輕量級模型的實務編碼表現進行系統性比較。講者在 Mac Studio 上運行 Qwen 3.8 27B 與 DeepSeek V4 Flash,於 Poe.dev 代理環境中執行三個難度遞增的編碼任務。所有輸出均限制為自包含 HTML 檔案,禁用外部依賴或多檔案架構,模擬現實開發環境中對模型自主完成能力的考驗。

天氣儀表板是最初級測試。Qwen 版本展現更優的使用者體驗:搜尋「Melbourne」時呈現澳洲與美國兩個選項供使用者選擇,並主動顯示經緯度座標。這些細節不在原始提示中明確要求,卻體現了模型對常見使用者需求的預判。相比之下,DeepSeek 版本默認澳洲墨爾本,無選項機制,且天氣圖示部分無法渲染。兩版本都正確實現了溫度、濕度、7 天預報與 24 小時預報等核心功能,但 Qwen 的版面佈局與互動流程明顯更直觀。

塔防遊戲進入中等難度。講者特別強調:給 27B 級模型一個「建塔防遊戲」的模糊指令時,它們通常會遺漏某些關鍵功能(如無法拖放、無法射擊敵人)。為避免此問題,講者在提示中明確描述了棋盤大小、塔的種類(Archer、Cannon)、敵人行為、升級機制(3 次升級、70% 出售價格)等細節。兩個模型都成功實現了所有功能。Qwen 版本要求先點擊塔再點擊棋盤位置放置,UI 按鈕會因文字變化而位移,覆蓋遊戲畫面。DeepSeek 版本則提供更清晰的使用者引導(「選擇塔,然後點擊草地儲存格」),並在放置時即時顯示射程圓圈,版面居中且乾淨。Qwen 版本的路徑視覺有細微差異,但整體功能對等,講者評為五五開。

試算表測試才是真正考驗模型的任務。首輪沒有推理的結果中,Qwen 無法響應點擊事件(原因是程式碼在整個畫布上放置了一個看不見的覆蓋層),而 DeepSeek 可以點擊但無法輸入或儲存值。講者隨後多輪重新提示,每輪只描述症狀(「我無法點擊儲存格」或「我無法輸入值」)而非直接修改程式碼。Qwen 在第三輪時部分突破了覆蓋層問題,但仍無法完全運作所有儲存格。DeepSeek 經歷相同的多輪迭代後,仍然無法讓使用者輸入任何值。檢查源碼後發現 DeepSeek 缺少了鍵盤輸入事件處理函數或單個關鍵字元,導致整個輸入系統崩潰。

轉折發生在新對話中啟用推理模式的測試。講者在新的 Poe.dev 環境中同時開啟思考模式與設定推理努力為「低」。在這個配置下,Qwen 首輪即產生完全可用的試算表:使用者可以點擊任何儲存格輸入數值(如「10」),系統正確儲存;可以撰寫公式(A1*B1 = 580、AVERAGE(A1:B1) = 34),計算結果準確顯示。唯一小缺陷是某些儲存格的選擇狀態會黏著,按 Escape 可清除。DeepSeek 在相同推理配置下仍舊失敗:點擊與輸入都存在問題,即使輸入文字似乎有反應,最終也無法持久化到儲存格。DeepSeek 版本的 UI 在邊界對齊上更像 Google Sheets(貼邊設計),是唯一的優點。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。