Tencent HY3: New FREE Chinese Open Source AI!
三句話摘要
HY3 是來自中國的新開源 AI 模型,免費提供 API 訪問,講者通過實測對其性能與主流模型進行對比評估。 HY3 以完全免費、開源、支持代理框架為核心優勢,但代碼質量與視覺細節不及前沿模型,最適合預算受限且以自動化任務為主的應用場景。 HY3 的定位是代理 AI 任務而非前沿模型。講者通過遊戲、網站生成等實測發現,雖然輸出可運行,但在圖形細節、色彩準確度和整體質感上明顯弱於 Fable 5、GLM 5.2,需多小時反覆調整才能接近預期。
重點整理
重點- 1
HY3 的定位是代理 AI 任務而非前沿模型。講者通過遊戲、網站生成等實測發現,雖然輸出可運行,但在圖形細節、色彩準確度和整體質感上明顯弱於 Fable 5、GLM 5.2,需多小時反覆調整才能接近預期。
- 2
開源與免費是最大優勢。OpenRouter 免費提供至 7 月 21 日,也支持本地部署,讓預算受限的開發者有了可行的 AI 代理選擇。
- 3
特別適合 Hermes 代理框架集成。在 Hermes 框架中測試時,HY3 的瀏覽能力和代碼生成速度都不錯,可快速執行網頁閱讀、技能學習等任務。
- 4
基準測試與實際表現存在落差。HY3 在 Claude Eval 等公開基準上擊敗 GLM 5.2,但實測中的體驗明顯不同,因此講者建立了 Goldy Bench 進行真實場景驗證。
實用技巧與重點
乾貨- 模型規格
- 參數規模:295 億參數
- 架構:混合專家模型(MoE),活躍參數 21 億
- 來源:中國開源項目
- 免費訪問方式
- OpenRouter 免費 API(至 2026 年 7 月 21 日)
- Hugging Face
- Kilo Code
- 對標模型(講者偏好排序)
- Fable 5、Claude/Opus 4.8
- GLM 5.2
- Hermes(混合代理框架)
- 測試應用場景
- 網頁創建與代碼生成
- 開放世界遊戲生成
- 城市驾驶模拟器、降落伞遊戲
- 視頻生成(搭配 Remotion 框架)
- 瀏覽器操作、Google 搜索、技能學習
- 性能基準
- Claude Eval 上擊敗 GLM 5.2
- MCP Atlas、Browsecom 等基準表現良好
- 實測與基準成績存在落差
- 測試投入
- 反覆測試飛行模擬器耗時 3-4 小時
- 需多次反饋調整
- 相關工具
- LM Studio(預期支持本地運行)
- Goldy Bench(講者自建模型測試平台)
- Remotion(視頻生成框架)
結論
結論“HY3 以完全免費、開源、支持代理框架為核心優勢,但代碼質量與視覺細節不及前沿模型,最適合預算受限且以自動化任務為主的應用場景。”
完整解析
詳細HY3 是中國最新推出的開源 AI 模型,規模為 295 億參數,採用混合專家架構,只有 21 億參數在任一時刻激活。講者在自開發的 Goldy Bench 平台上進行了全面測試,並將其集成到代理操作系統中進行實戰評估。
HY3 最大的吸引力是完全免費。OpenRouter 已將其免費提供至 2026 年 7 月 21 日,用戶只需查詢「HY3」即可獲得 API 密鑰。此外還可在 Hugging Face 和 Kilo Code 上免費訪問。對於預算有限但需要 AI 能力的開發者而言,這是重要選項。講者將其集成到 Hermes 代理框架中測試,發現其瀏覽能力和基礎代碼生成速度都不錯,可快速執行網頁讀取、技能學習等自動化任務。
然而講者的實測表明,HY3 有明顯的能力天花板。在多次創意任務測試中——包括生成開放世界遊戲、城市駕駛模擬器、降落傘遊戲等——HY3 的輸出都存在細節不足、圖形基礎、色彩單調等問題。雖然代碼在語法上正確運行,但整體質感遠不如前沿模型(如 Fable 5)或優質開源模型(如 GLM 5.2)。講者在飛行模擬器上花了 3-4 小時反覆調整提示詞,最後輸出仍未達預期。這說明 HY3 在處理複雜、細節密集的任務時存在能力瓶頸。
有趣的是,HY3 在公開基準測試上表現相對不錯,甚至在 Claude Eval 上擊敗 GLM 5.2。但講者強調基準成績與實際體驗存在落差,因此開發了 Goldy Bench 在真實場景中驗證。講者的結論是:HY3 最適合定位為「代理任務的廉價選擇」而非「前沿級代碼生成工具」。若要構建 AI 代理執行自動化任務,HY3 是不錯的免費替代方案;但若追求代碼質量和用戶體驗最優化,應優先選擇 Fable 5、Claude 或 Opus 4.8。值得一提的是,給 HY3 提供 Remotion(視頻生成框架)訪問權限後,它可生成動畫視頻,效果好於許多其他開源項目。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


