KeyFrame內部研究專用

DeepSeek V4 Pro正式版编程到底有多强?对比 Grok 4.6、Kimi K3 实测

AI随风·8月13日週四·5 min中文

三句話摘要

對比測試 Claude 4.6、DeepSeek v4 及 Kimi K3 在前端編程(粒子特效、3D 開發)的性能表現。 不考慮成本選飛步和 Kimi K3,考慮成本則 DeepSeek v4 Pro 性價比最高,但選擇模型應根據具體專案需求和預算綜合評估。 統一測試框架:使用同一工具(Claude Code)進行測試,確保不同模型結果的可比性,避免工具差異帶來的偏差。

重點整理

重點
  • 1

    統一測試框架:使用同一工具(Claude Code)進行測試,確保不同模型結果的可比性,避免工具差異帶來的偏差。

  • 2

    粒子特效場景設計:第一個例子測試火焰燃燒的細緻程度、灰燼效果、背景色調動態調整;第二個例子則測試複雜 3D 場景(包含光線、波浪、船隻偵測、警報、風暴等多重元素)。

  • 3

    性能與費用的權衡:飛步和 Kimi K3 視覺效果最佳但成本高;DeepSeek v4 Pro 視覺效果略遜但費用明顯便宜,重新調整參數後能達到接近的效果。

  • 4

    視覺能力短板:DeepSeek 系列在視覺和前端開發能力上相對較弱,這是該系列模型的已知落差;前端開發作為軟體開發不可或缺的環節,改進視覺理解能力應為未來優化重點。

實用技巧與重點

乾貨
  • 測試工具:Claude Code
  • 參與測試模型:Claude 4.6、DeepSeek v4 Pro 正式版、DeepSeek v4 Flash 正式版、Kimi K3、飛步
  • 測試場景 1:燃燒紙張粒子特效
  • 測試項目:火焰精細度、灰燼效果、背景色調動態變化
  • 測試場景 2:3D 燈塔複雜場景
  • 包含元素:燈塔、海洋波浪、船隻、警報、暴雨、雷電
  • 交互功能:波浪高度可調、風暴強度可調、緊急模式(自動鎖定並掃描船隻)
  • 性能排名(不考慮成本):飛步 > Kimi K3 > Claude 4.6 > DeepSeek v4 Pro > DeepSeek v4 Flash
  • 性價比排名:DeepSeek v4 Pro(成本最低,調整後可達中上水平)> Claude 4.6 > Kimi K3 > 飛步
  • 特殊發現:DeepSeek v4 Pro 是唯一生成背景音樂/聲效的模型;重新開啟新對話後效果明顯改善

結論

結論

不考慮成本選飛步和 Kimi K3,考慮成本則 DeepSeek v4 Pro 性價比最高,但選擇模型應根據具體專案需求和預算綜合評估。

完整解析

詳細

隨著 Claude 4.6 和 DeepSeek v4 系列在同一天發佈更新,這兩個重要模型的新版本成為立即對比的對象。從官方公佈的參數對比來看,這些模型在參數量上相差不大,但成本卻存在顯著差異——DeepSeek v4 系列價格遠低於競爭對手,這使得性價比成為一個值得深入探討的話題。

為了進行全面的評估,測試者準備了兩個前端開發場景。第一個場景是燃燒紙張特效,主要考驗粒子效果的細節表現——火焰的精緻度、灰燼的逼真程度,以及背景色調如何動態配合火焰而變化。第二個場景則更為複雜,涉及一個 3D 燈塔場景,內含燈塔結構、動態海浪(可調整波浪高度)、船隻、警報系統、暴雨和雷電效果。場景還包含「緊急模式」功能,可自動鎖定船隻並持續掃描,是對模型 3D 開發和邏輯實現能力的綜合考驗。

測試結果顯示了明顯的性能分化。在不考慮成本的情況下,飛步表現獨一檔,Kimi K3 無限接近其水平。Claude 4.6 排名第三,火焰效果雖不如飛步細緻但整體表現穩定。DeepSeek v4 Pro 在第一次嘗試時效果較差(燈塔結構斷裂、出現黑影干擾),但重新開啟 Claude Code 對話後效果明顯改善,表明上下文管理是影響輸出品質的關鍵因素。相比之下,DeepSeek v4 Flash 在兩個測試場景中表現最差,雨滴效果缺失、波浪效果不明顯。值得一提的是,DeepSeek v4 Pro 是唯一生成背景音樂和聲效的模型,展現了多模態理解的優勢。

然而,當將成本因素納入考量時,評估結果截然不同。DeepSeek v4 Pro 因其顯著的成本優勢成為首選,儘管視覺效果不是最優,但通過調整參數可達到接近中上等級的效果,而費用遠低於 Kimi K3 或飛步。Claude 4.6 則排名第二,性能穩定且成本可接受。這個測試反映了 DeepSeek 在視覺理解和前端開發領域的相對短板,這是該系列模型未來需要改進的方向。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。