KeyFrame內部研究專用

🚀DeepSeek V4 Flash全面实测:Claude Code接入后连续开发7个项目,最便宜的国产模型!性能、速度与真实短板全曝光!对比Kimi K3优点和缺点都藏不住!是否超越Opus 4.8

AI超元域·7月31日週五·13 min中文

三句話摘要

DeepSeek V4 Flash 模型性能實測與 API 成本評估 DeepSeek V4 Flash 是目前最便宜的國產大模型,性能與成本的比例堪稱最優,適合作為高端模型的代碼生成副助手。 官方性能指標領先:根據官方發布的 9 項基準測試,DeepSeek V4 Flash 完全超越前代 V4 Pro,能力接近 Claude Opus 4.8,同時碾壓國產 GLM 5.2。

重點整理

重點
  • 1

    官方性能指標領先:根據官方發布的 9 項基準測試,DeepSeek V4 Flash 完全超越前代 V4 Pro,能力接近 Claude Opus 4.8,同時碾壓國產 GLM 5.2。

  • 2

    知識截止日期有限制:模型知識截止於 2025 年初,無法回答最新實時信息,但對於需要歷史知識的任務仍可勝任。

  • 3

    複雜任務能力參差不齊:多步驟任務(網絡搜索 + 代碼生成)表現良好,但高精度 3D 遊戲開發與複雜互動設計較為粗糙,反映出參數量小的限制。

  • 4

    成本效益最優:API 定價相比 V4 Pro 更便宜,整個測試套件(包括 iOS 原生開發)僅花費 1.4 元人民幣,是國產模型中最經濟的選擇。

實用技巧與重點

乾貨
  • 模型規格:總參數 284b,激活參數 13b,上下文窗口 100 萬 tokens
  • 官方性能對標:能力接近 Claude Opus 4.8,超越 GLM 5.2
  • 知識截止日期:2025 年 1 月
  • 測試任務耗時:
  • 《極光》科幻小說飛船還原 - 20 分鐘(需網絡搜索)
  • 《荒野大鏢客》騎馬遊戲 - 30 分鐘
  • Three.js 谷歌齒輪動畫 - 14 分鐘
  • 手繪燈泡 SVG 動畫 - 快速完成
  • 數學函數 MATHJAX 可視化 - 快速完成
  • 虛幻引擎 5 坦克遊戲 - 39-40 分鐘
  • iOS 原生被單詞應用 - 24 分鐘
  • API 消費統計:全部測試花費 1.4 元人民幣(充值 20 元後剩餘 18.58 元)
  • 上下文使用:iOS 應用開發達 100% 佔用

結論

結論

DeepSeek V4 Flash 是目前最便宜的國產大模型,性能與成本的比例堪稱最優,適合作為高端模型的代碼生成副助手。

完整解析

詳細

DeepSeek 於今日發布 V4 Flash 0731 模型,官方宣稱其基準測試已接近 Claude Opus 4.8 水準,並超越國產 GLM 5.2。為驗證這些聲稱,測試者通過 Claude Code 的 API 調用功能進行系統評估。首先確認模型知識截止於 2025 年初,無法回答當前年份的實時信息,但整體知識完整度良好。

在創意代碼生成測試中,模型展現出良好的多步驟任務能力。要求模型搜索科幻小說《極光》並用前端技術還原飛船設計時,模型成功調用網絡搜索功能,耗時 20 分鐘生成了包含噴火效果、載物倉、磁場清除裝置等細節的互動式飛船,效果與 Claude 3 相近。

在遊戲開發能力評測上,模型的表現呈現明顯分層。《荒野大鏢客》騎馬場景還原耗時 30 分鐘,成功實現馬匹、風聲、馬蹄聲、天空葉片、動態照明等環保效果,使用體驗流暢。谷歌齒輪 Three.js 動畫則在 14 分鐘內完成,轉速計算準確、光影效果不錯,但齒輪間邏輯連接欠缺。手繪燈泡 SVG 動畫生成迅速,視覺效果模擬人類手繪的動畫流暢度尚可。

更複雜的任務測試顯示了參數量小的限制。MATHJAX 數學函數可視化順利完成,但虛幻引擎 5 坦克遊戲開發則耗時 40 分鐘,上下文窗口達到 96% 佔用,最終只實現基本框架,未完成所有設計需求(恐龍數量不足、坦克控制困難)。最後的 iOS 原生應用開發則意外成功:被單詞學習應用在 24 分鐘內完成全部開發,成功在 Xcode 編譯運行,功能完善(發音、收藏、測試、進度追蹤、主題設置),雖有深色模式適配的小 bug 但整體 MVP 可用。

最值得關注的是成本效益:整個龐大的測試套件僅花費約 1.4 元人民幣。這使 DeepSeek V4 Flash 成為國產模型中最經濟的選擇,適合用作主模型的代碼生成副代理,由高端模型負責規劃,由 Flash 執行具體實現,實現成本與性能的最優平衡。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。