KeyFrame內部研究專用

Qwen3.8-27B同級開源榜首,但它有個燒錢毛病|AI 散步日記每日 AI 新聞彙整 0822

AI 散步日記··39 min中文

三句話摘要

十則AI產業週報:從模型排名悖論、成本效益轉變、開源基建民主化到職場知識結構的變革。 AI採購決策已從「誰的排名最高」轉向「誰的ROI最好、工程最可靠」;同時隱私、架構與人類意圖文件的價值翻升,開源基建民主化使得中小團隊也有機會構建過去只有大公司做得起的企業級AI應用。 成本與性能的徹底分離:Qwen 3.8因冗長推理導致費用高昂卻排名最強,GLM 5.3排名較低卻最划算。傳統榜單忽視成本因子,暴露評測設計缺陷,企業採購應從ROI而非排名決策。

重點整理

重點
  • 1

    成本與性能的徹底分離:Qwen 3.8因冗長推理導致費用高昂卻排名最強,GLM 5.3排名較低卻最划算。傳統榜單忽視成本因子,暴露評測設計缺陷,企業採購應從ROI而非排名決策。

  • 2

    開源基建民主化翻轉產業形態:DeepSeek Harness與Prime Agent框架開源,讓只改設定檔就能切換模型,過去只有大公司做得起的AI代理系統現在小團隊也能構建。

  • 3

    工程設計等同甚至超越模型本身:千問辦公的勝利主要來自Harness的任務拆解與糾錯能力,而非模型參數。開源小模型配好框架已能逼近頂級閉源模型,代表「會做事」比「會想」更稀缺。

  • 4

    隱私敏感度與工作流轉變:本機模型讓敏感資料不用上傳,虛擬內容真實性不再必要,職場知識摊公開才有AI價值——這些變化重塑企業對資料、工作流與人才的認知。

實用技巧與重點

乾貨
  • 模型成本數據
  • Qwen 3.8 27B:輸入0.43美元/百萬token,輸出3.10美元/百萬token
  • GLM 5.3:輸入1.4美元,輸出4.4美元/百萬token
  • 中位數:輸入0.05、輸出0.15
  • Qwen輸入貴8倍、輸出貴20倍;單次測評成本666.92美元
  • 智慧指數排名
  • Qwen 3.8 27B:同級開源權重第一名(135個模型排名中)
  • GLM 5.3:182個模型排第八名,比中位數高出快一倍
  • Context Window與速度
  • Qwen 3.8:256k token(約384頁A4紙)
  • GLM 5.3:100萬token(約1500頁);輸出93.2 token/秒;首字延遲1.92秒
  • 開源工具
  • DeepSeek Harness(dsh):MIT授權,micro-kernel架構,內建Standard/Code/Minimal/Creator四種模式
  • GitHub星數:17.6萬
  • Prime Agent Harness:讓Kimi K3追平部分閉源模型
  • 辦公AI實測(杰富瑞分析師)
  • 千問辦公:所有測評維度90分以上(唯一一個)
  • 測試項目:報告摘要、資料比對、文件生成、簡報、海報設計
  • 入口:qwenwork.cn/app、桌面端、鉤鉤App
  • 本機模型運行
  • `ollama run qwen3.8:27b`(完整版)
  • `qwen3:4b`(小版本)、`qwen3:8b-q4_K_M`(中版本含完整標籤)
  • 推理開關:`/think`啟動、`/no_think`關閉
  • AI虛擬網紅成本
  • 角色名稱:Janie
  • 製作成本:約100美元
  • 每日時間:約30分鐘
  • 觀看表現:一週約100萬觀看;8支被TikTok標為AI生成但無損觀看表現
  • 工具清單
  • 本機執行:Ollama
  • 圖轉動畫:MiniMax H3(API)、Grok Imagine(網頁/App)
  • 伪代碼編輯:Huzzah(.hz檔案格式)
  • Slack整合:Claude插件(頻道內直接提請求)

結論

結論

AI採購決策已從「誰的排名最高」轉向「誰的ROI最好、工程最可靠」;同時隱私、架構與人類意圖文件的價值翻升,開源基建民主化使得中小團隊也有機會構建過去只有大公司做得起的企業級AI應用。

完整解析

詳細

這個週報的核心議題是AI產業從「效能競賽」轉向「成本效益競賽」的關鍵轉折。

首先是排行榜的失效。Qwen 3.8雖然同級別遙遙領先,卻因為「喜歡長篇思考」,單次推理生成的output token超過中位數2.6倍。這導致雖然模型最聰明,費用卻最昂貴——輸出價達中位數的20倍。相對的,GLM 5.3排名第八,但輸出價只要中位數的40%多,速度還更快。這個對比戳破了一個業界假設:排名等於價值。實務上企業買單的不是分數,是ROI。

第二個信號是基建層的開源民主化。DeepSeek的Harness框架用micro-kernel架構,讓模型、工具、沙箱都變成可抽換模組。開發者只需改YAML設定檔就能從OpenAI切到Claude再切到Qwen,完全不用改程式碼。這解決了過去每家都自己刻一套執行環境、重複造輪子的問題。當Prime Agent的實驗證實「開源模型Kimi K3配上好框架已能逼近部分旗艦模型」時,護城河開始從「模型本身」遷移到「框架與工程」。

千問辦公的實測勝利正是這個趨勢的具體證明。報告特別拆分了「模型」與「Harness」兩塊評分,千問的勝利主要來自Harness——它會自動拆解任務、檢查數字對不對、發現問題重做。相比之下,其他工具在個別維度有短板。這代表過去「模型參數最大=最聰明」的時代已經過去,現在是「會做事的框架」才能贏。

第三個信號是隱私敏感度的上升。本機模型Qwen 3.8只要270億參數卻能打敗參數多28倍的云端旗艦,這讓「合約、病歷、客戶名單這類敏感資料也能在自己電腦上處理」成為可能。同時,虛擬網紅Janie用100美元、每天30分鐘生成百萬觀看,卻在被標為AI內容後觀看行為幾乎沒變。這暴露出「真實性」在注意力市場上已經不是必要條件,只是可有可無的加分項——企業和個人都開始重新評估什麼值得信任。

第四個信號是人類在AI工作流中角色的轉變。Claude Code讓非工程師用計畫模式先看方案再執行,Huzzah把程式碼改成從伪代碼生成(留下人的意圖檔案),這些工具的共同假設是:人的核心價值正在從「執行細節」遷移到「決策邏輯」。工程師也開始只維護伪代碼而非不斷重複描述需求,對話紀錄變成廢棄物,意圖檔案才是資產。

最後是職場知識結構的隱憂。Slack主張「知識全鎖在私訊時,AI代理就無用」,所以企業應把知識摊公開頻道。但這等於要求員工在全公司可見的地方討論薪資、戰略、個人意見,帶來隱私與權限的兩難。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。