KeyFrame內部研究專用

Tencent HY3: New FREE Chinese Open Source AI!

Julian Goldie SEO·7月6日週一·9 min英文

三句話摘要

HY3 是來自中國的新開源 AI 模型,免費提供 API 訪問,講者通過實測對其性能與主流模型進行對比評估。 HY3 以完全免費、開源、支持代理框架為核心優勢,但代碼質量與視覺細節不及前沿模型,最適合預算受限且以自動化任務為主的應用場景。 HY3 的定位是代理 AI 任務而非前沿模型。講者通過遊戲、網站生成等實測發現,雖然輸出可運行,但在圖形細節、色彩準確度和整體質感上明顯弱於 Fable 5、GLM 5.2,需多小時反覆調整才能接近預期。

重點整理

重點
  • 1

    HY3 的定位是代理 AI 任務而非前沿模型。講者通過遊戲、網站生成等實測發現,雖然輸出可運行,但在圖形細節、色彩準確度和整體質感上明顯弱於 Fable 5、GLM 5.2,需多小時反覆調整才能接近預期。

  • 2

    開源與免費是最大優勢。OpenRouter 免費提供至 7 月 21 日,也支持本地部署,讓預算受限的開發者有了可行的 AI 代理選擇。

  • 3

    特別適合 Hermes 代理框架集成。在 Hermes 框架中測試時,HY3 的瀏覽能力和代碼生成速度都不錯,可快速執行網頁閱讀、技能學習等任務。

  • 4

    基準測試與實際表現存在落差。HY3 在 Claude Eval 等公開基準上擊敗 GLM 5.2,但實測中的體驗明顯不同,因此講者建立了 Goldy Bench 進行真實場景驗證。

實用技巧與重點

乾貨
  • 模型規格
  • 參數規模:295 億參數
  • 架構:混合專家模型(MoE),活躍參數 21 億
  • 來源:中國開源項目
  • 免費訪問方式
  • OpenRouter 免費 API(至 2026 年 7 月 21 日)
  • Hugging Face
  • Kilo Code
  • 對標模型(講者偏好排序)
  • Fable 5、Claude/Opus 4.8
  • GLM 5.2
  • Hermes(混合代理框架)
  • 測試應用場景
  • 網頁創建與代碼生成
  • 開放世界遊戲生成
  • 城市驾驶模拟器、降落伞遊戲
  • 視頻生成(搭配 Remotion 框架)
  • 瀏覽器操作、Google 搜索、技能學習
  • 性能基準
  • Claude Eval 上擊敗 GLM 5.2
  • MCP Atlas、Browsecom 等基準表現良好
  • 實測與基準成績存在落差
  • 測試投入
  • 反覆測試飛行模擬器耗時 3-4 小時
  • 需多次反饋調整
  • 相關工具
  • LM Studio(預期支持本地運行)
  • Goldy Bench(講者自建模型測試平台)
  • Remotion(視頻生成框架)

結論

結論

HY3 以完全免費、開源、支持代理框架為核心優勢,但代碼質量與視覺細節不及前沿模型,最適合預算受限且以自動化任務為主的應用場景。

完整解析

詳細

HY3 是中國最新推出的開源 AI 模型,規模為 295 億參數,採用混合專家架構,只有 21 億參數在任一時刻激活。講者在自開發的 Goldy Bench 平台上進行了全面測試,並將其集成到代理操作系統中進行實戰評估。

HY3 最大的吸引力是完全免費。OpenRouter 已將其免費提供至 2026 年 7 月 21 日,用戶只需查詢「HY3」即可獲得 API 密鑰。此外還可在 Hugging Face 和 Kilo Code 上免費訪問。對於預算有限但需要 AI 能力的開發者而言,這是重要選項。講者將其集成到 Hermes 代理框架中測試,發現其瀏覽能力和基礎代碼生成速度都不錯,可快速執行網頁讀取、技能學習等自動化任務。

然而講者的實測表明,HY3 有明顯的能力天花板。在多次創意任務測試中——包括生成開放世界遊戲、城市駕駛模擬器、降落傘遊戲等——HY3 的輸出都存在細節不足、圖形基礎、色彩單調等問題。雖然代碼在語法上正確運行,但整體質感遠不如前沿模型(如 Fable 5)或優質開源模型(如 GLM 5.2)。講者在飛行模擬器上花了 3-4 小時反覆調整提示詞,最後輸出仍未達預期。這說明 HY3 在處理複雜、細節密集的任務時存在能力瓶頸。

有趣的是,HY3 在公開基準測試上表現相對不錯,甚至在 Claude Eval 上擊敗 GLM 5.2。但講者強調基準成績與實際體驗存在落差,因此開發了 Goldy Bench 在真實場景中驗證。講者的結論是:HY3 最適合定位為「代理任務的廉價選擇」而非「前沿級代碼生成工具」。若要構建 AI 代理執行自動化任務,HY3 是不錯的免費替代方案;但若追求代碼質量和用戶體驗最優化,應優先選擇 Fable 5、Claude 或 Opus 4.8。值得一提的是,給 HY3 提供 Remotion(視頻生成框架)訪問權限後,它可生成動畫視頻,效果好於許多其他開源項目。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。