KeyFrame內部研究專用

🚀只花5元开发了5个复杂项目!DeepSeek V4 Pro深度实测:1M上下文接入Claude Code实测表现竟然超过Kimi K3?Token超便宜,能力也不弱!实测开发游戏与macOS应用

AI超元域·8月13日週四·15 min中文

三句話摘要

DeepSeek V4 Pro 0813 模型的編程開發能力綜合測試與成本驗證。 DeepSeek V4 Pro 以最低 API 成本和全棧編程能力,成為開發者進行遊戲、應用、3D 項目的經濟型首選模型。 超大上下文與輸出容量:100 萬 Token 上下文加 384K 最大輸出,能處理超長任務輸入與生成大規模代碼,為複雜開發項目提供充足的運作空間。

重點整理

重點
  • 1

    超大上下文與輸出容量:100 萬 Token 上下文加 384K 最大輸出,能處理超長任務輸入與生成大規模代碼,為複雜開發項目提供充足的運作空間。

  • 2

    極端價格優勢:7 項包括遊戲開發、3D 建模、應用開發的複雜任務僅花 5.36 人民幣,對標其他同級模型(如 Kimi 3)成本優勢顯著,是經濟型選擇。

  • 3

    全棧編程能力:在 SVG 動畫、Three.js、Godot、SwiftUI、Manim 等多個技術棧上均能輸出 MVP 級可運行代碼,無明顯短板。

  • 4

    高級推理與自主決策:搜索科幻小說任務中自動識別搜索結果矛盾、多次調整關鍵詞驗證、最終精準還原原著飛船模型,體現模型的邏輯推敲與工具調用能力。

實用技巧與重點

乾貨
  • 模型規格
  • 名稱:DeepSeek V4 Pro 0813
  • 上下文長度:100 萬 Token
  • 最大輸出:384K Token
  • API 價格:0.025 人民幣/百萬輸出 Token(緩存命中),6 元/百萬輸出 Token(標準)
  • 測試清單與耗時
  • | 測試項目 | 技術棧 | 耗時 | 對標結果 |
  • |---------|--------|------|---------|
  • | 土星星環自行車賽 | SVG | 快速 | 不如 Kimi 3 |
  • | 齒輪機械模擬 | Three.js | 20 分鐘 | 超越 Kimi 3 |
  • | 《極光》飛船 3D 還原 | Three.js | 27 分鐘 | 超越 Kimi 3 |
  • | 南宋古城遊戲 | Babylon.js | 26 分鐘 | 超越 Kimi 3 |
  • | 二次函數可視化 | Manim | 14 分鐘 | 超越 DeepSeek Flash |
  • | 坦克 vs 恐龍遊戲 | Godot | 32 分鐘 | 首次成功運行 |
  • | 音樂播放器 | SwiftUI | 完成 | 功能完整 |
  • 成本驗證
  • 初始額度:18.58 人民幣
  • 7 項測試總消耗:5.36 人民幣
  • 剩餘額度:13.22 人民幣
  • 實現功能範例
  • SwiftUI 音樂播放器:推薦首頁、音樂庫分類、迷你播放器、收藏機制
  • 遊戲系統:NPC 對話、敵人 AI、道具系統、粒子效果、音效
  • 3D 模型:飛船內部探索、100+ 細節還原、防護盾、貨艙、可交互元素

結論

結論

DeepSeek V4 Pro 以最低 API 成本和全棧編程能力,成為開發者進行遊戲、應用、3D 項目的經濟型首選模型。

完整解析

詳細

DeepSeek 在 8 月 13 日正式發佈 V4 Pro 0813 模型,配備 100 萬 Token 超寬上下文和 384K 最大輸出容量,最亮眼的是 API 定價——緩存命中僅 0.025 人民幣每百萬輸出 Token,成為業界最便宜的選項之一。測試者決定用實際編程項目驗證這款模型,初始額度為 18.58 人民幣。

測試從 SVG 動畫開始。模型被要求繪製三隻鳥在土星星環上騎自行車的動畫場景。生成速度快,鳥類造型與動作逼真,但土星環與背景行星的透視銜接不如競品 Kimi 3 完美。隨後的 Three.js 齒輪系統測試顯示明顯進步——齒輪齒合精準、支持 360 度旋轉檢視、轉速可調節,甚至新增了馬達細節,綜合表現超越了 Kimi 3。

最具挑戰的是複刻科幻小說《極光》中的宇宙飛船。模型耗時 27 分鐘自主執行了完整工作流:搜索小說原文、識別搜索結果間的矛盾(如飛船描述不一致)、精準調整搜索詞、逐步驗證細節。最終生成的 3D 飛船還原度驚人——船體結構、防護盾、貨艙等百多個細節逐一實現,甚至支持飛船內部進入探索,遠超 Kimi 3 的同等任務。緊接著的南宋古城遊戲(26 分鐘)驗證了模型對複雜遊戲邏輯的理解——完整 NPC 系統、敵人追殺 AI、場景細節、可玩的 MVP 級體驗。

數學領域方面,模型用 Manim 在 14 分鐘內生成了二次函數的完整動畫可視化,包含表達式、曲線繪製、頂點和零點標註。Godot 引擎的坦克 vs 恐龍遊戲則展示了其複雜 3D 邏輯處理能力——實現了坦克操控、恐龍多樣化行為、UFO 敵人、粒子特效與音效,從而達成可玩級別。最後的 SwiftUI 測試複製了 Apple Music 的完整功能框架——推薦系統、分類音樂庫、迷你播放器、收藏功能,且能在 Xcode 中直接運行。

7 項測試的實際成本僅 5.36 人民幣,遠低於預期。這一結果證明 DeepSeek V4 Pro 不僅能力全面(遊戲開發、3D 建模、應用開發、數據可視化一應俱全),且經濟優勢突出,在性價比上已成為同級模型中的首選。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。