KeyFrame內部研究專用

A1 Agent: New FREE Chinese AI is INSANE!

Julian Goldie SEO·7月5日週日·7 min英文

三句話摘要

介紹 Agent A1——一個免費、可本地運行的中文開源模型,展示其在代碼生成與代理任務中的表現。 Agent A1 是面向本地代理與研究任務的高效免費選擇,關鍵優勢在於推理速度與工具調用能力,適合資源受限或隱私優先的場景,但應認清其非通用模型的定位。 性能定位清晰:Agent A1 專為代理任務設計,在 SEAL、長視野搜尋、指令跟隨與工具調用上宣稱達到最先進水平;雖性能(4.8/10)低於 Qwen(7.14),但速度(9.5 tokens/sec)優於 Gemma 4 與 Qwen,適合資源受限環境。

重點整理

重點
  • 1

    性能定位清晰:Agent A1 專為代理任務設計,在 SEAL、長視野搜尋、指令跟隨與工具調用上宣稱達到最先進水平;雖性能(4.8/10)低於 Qwen(7.14),但速度(9.5 tokens/sec)優於 Gemma 4 與 Qwen,適合資源受限環境。

  • 2

    應用邊界明確:強項在研究、工程、代碼生成(已驗證可構建小型應用、遊戲、可視化),劣勢在視覺任務與 UI 設計,不與 Frontier 模型競爭。

  • 3

    本地部署優勢:256K 上下文足應對大部分任務,Mixture of Experts 架構降低運算成本,完全私密離線運行,支援 Ollama 與 Hermes 整合。

  • 4

    完整生態支持:講者展示的「Agent OS」包含多模型配置文件系統、本地編碼環境、Omniroot 自動路由 90+ 免費模型,降低速率限制風險。

實用技巧與重點

乾貨
  • 模型規格:35 billion parameter、3 billion 激活、256K context window
  • 性能指標:9.5 tokens/second (MLX on Mac Studio M4)、HLE benchmark 超越 Quen 3.6 與 Step 3.5 Flash
  • 排行榜排名:本地模型第二名(Goldpile Bench)
  • 來源:Intern Science(Shanghai AI Laboratory 旗下開源 AI 科學中心)
  • 聲稱優化方向:long horizon search、engineering、scientific research、instruction following、tool calling
  • 部署方式:Ollama + Hermes(終端命令設置本地配置文件)
  • 應用驗證案例:鍵盤合成器、Snake 遊戲、登陸頁面、太陽系 3D 可視化、Agent Factory 集成
  • 補充工具:Omniroot(自動路由 90 個免費模型)

結論

結論

Agent A1 是面向本地代理與研究任務的高效免費選擇,關鍵優勢在於推理速度與工具調用能力,適合資源受限或隱私優先的場景,但應認清其非通用模型的定位。

完整解析

詳細

Agent A1 是上海 AI 實驗室旗下 Intern Science 在 24 小時前發佈的 35B 參數 Mixture of Experts 模型,核心面向代理任務場景。講者在自己的「Agent Factory」環境中測試後發現,儘管在單純性能指標(HLE benchmark 4.8/10)上不及 Qwen(7.14),但在實際本地推理速度上表現優異——在 Mac Studio M4 的 MLX 環境達到 9.5 tokens/second,遠快於 Gemma 4,在本地模型排行榜上排名第二。

模型設計的關鍵特性在於其優化方向。Agent A1 專為長視野搜尋、工程任務、科學研究、指令跟隨與工具調用而生,而非通用能力。講者的實驗驗證了這一點——用它構建的應用包括功能鍵盤、遊戲、登陸頁面與 3D 可視化,展現出在代碼生成中的實用價值。其 256K 上下文窗口對多數任務而言已足夠,Mixture of Experts 架構只激活 3B 參數,降低了本地運行的計算成本。

從部署角度看,Agent A1 完全免費、可通過 Ollama 本地離線運行,支援 Hermes 代理框架整合。講者展示的設置流程簡單——在終端進入 Hermes、切換為 Ollama 後端、指定 A1 模型、在 Profiles 中創建新配置文件即可。更進一步,他所開發的「Agent OS」生態系統包含多模型管理、本地編碼環境與 Omniroot(一個自動路由 90+ 免費模型的開源工具),能規避速率限制與中斷。

不過,Agent A1 的應用邊界也很清晰:它不適合視覺設計與 UI 相關任務,主要適用於研究、工程代碼與代理迴圈。講者明確指出這不是 Frontier 模型,無意與 Fable 5 等競爭,而是填補「本地免費代理能力」的空白。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。