Qwen3.8-27B同級開源榜首,但它有個燒錢毛病|AI 散步日記每日 AI 新聞彙整 0822
三句話摘要
十則AI產業週報:從模型排名悖論、成本效益轉變、開源基建民主化到職場知識結構的變革。 AI採購決策已從「誰的排名最高」轉向「誰的ROI最好、工程最可靠」;同時隱私、架構與人類意圖文件的價值翻升,開源基建民主化使得中小團隊也有機會構建過去只有大公司做得起的企業級AI應用。 成本與性能的徹底分離:Qwen 3.8因冗長推理導致費用高昂卻排名最強,GLM 5.3排名較低卻最划算。傳統榜單忽視成本因子,暴露評測設計缺陷,企業採購應從ROI而非排名決策。
重點整理
重點- 1
成本與性能的徹底分離:Qwen 3.8因冗長推理導致費用高昂卻排名最強,GLM 5.3排名較低卻最划算。傳統榜單忽視成本因子,暴露評測設計缺陷,企業採購應從ROI而非排名決策。
- 2
開源基建民主化翻轉產業形態:DeepSeek Harness與Prime Agent框架開源,讓只改設定檔就能切換模型,過去只有大公司做得起的AI代理系統現在小團隊也能構建。
- 3
工程設計等同甚至超越模型本身:千問辦公的勝利主要來自Harness的任務拆解與糾錯能力,而非模型參數。開源小模型配好框架已能逼近頂級閉源模型,代表「會做事」比「會想」更稀缺。
- 4
隱私敏感度與工作流轉變:本機模型讓敏感資料不用上傳,虛擬內容真實性不再必要,職場知識摊公開才有AI價值——這些變化重塑企業對資料、工作流與人才的認知。
實用技巧與重點
乾貨- 模型成本數據
- Qwen 3.8 27B:輸入0.43美元/百萬token,輸出3.10美元/百萬token
- GLM 5.3:輸入1.4美元,輸出4.4美元/百萬token
- 中位數:輸入0.05、輸出0.15
- Qwen輸入貴8倍、輸出貴20倍;單次測評成本666.92美元
- 智慧指數排名
- Qwen 3.8 27B:同級開源權重第一名(135個模型排名中)
- GLM 5.3:182個模型排第八名,比中位數高出快一倍
- Context Window與速度
- Qwen 3.8:256k token(約384頁A4紙)
- GLM 5.3:100萬token(約1500頁);輸出93.2 token/秒;首字延遲1.92秒
- 開源工具
- DeepSeek Harness(dsh):MIT授權,micro-kernel架構,內建Standard/Code/Minimal/Creator四種模式
- GitHub星數:17.6萬
- Prime Agent Harness:讓Kimi K3追平部分閉源模型
- 辦公AI實測(杰富瑞分析師)
- 千問辦公:所有測評維度90分以上(唯一一個)
- 測試項目:報告摘要、資料比對、文件生成、簡報、海報設計
- 入口:qwenwork.cn/app、桌面端、鉤鉤App
- 本機模型運行
- `ollama run qwen3.8:27b`(完整版)
- `qwen3:4b`(小版本)、`qwen3:8b-q4_K_M`(中版本含完整標籤)
- 推理開關:`/think`啟動、`/no_think`關閉
- AI虛擬網紅成本
- 角色名稱:Janie
- 製作成本:約100美元
- 每日時間:約30分鐘
- 觀看表現:一週約100萬觀看;8支被TikTok標為AI生成但無損觀看表現
- 工具清單
- 本機執行:Ollama
- 圖轉動畫:MiniMax H3(API)、Grok Imagine(網頁/App)
- 伪代碼編輯:Huzzah(.hz檔案格式)
- Slack整合:Claude插件(頻道內直接提請求)
結論
結論“AI採購決策已從「誰的排名最高」轉向「誰的ROI最好、工程最可靠」;同時隱私、架構與人類意圖文件的價值翻升,開源基建民主化使得中小團隊也有機會構建過去只有大公司做得起的企業級AI應用。”
完整解析
詳細這個週報的核心議題是AI產業從「效能競賽」轉向「成本效益競賽」的關鍵轉折。
首先是排行榜的失效。Qwen 3.8雖然同級別遙遙領先,卻因為「喜歡長篇思考」,單次推理生成的output token超過中位數2.6倍。這導致雖然模型最聰明,費用卻最昂貴——輸出價達中位數的20倍。相對的,GLM 5.3排名第八,但輸出價只要中位數的40%多,速度還更快。這個對比戳破了一個業界假設:排名等於價值。實務上企業買單的不是分數,是ROI。
第二個信號是基建層的開源民主化。DeepSeek的Harness框架用micro-kernel架構,讓模型、工具、沙箱都變成可抽換模組。開發者只需改YAML設定檔就能從OpenAI切到Claude再切到Qwen,完全不用改程式碼。這解決了過去每家都自己刻一套執行環境、重複造輪子的問題。當Prime Agent的實驗證實「開源模型Kimi K3配上好框架已能逼近部分旗艦模型」時,護城河開始從「模型本身」遷移到「框架與工程」。
千問辦公的實測勝利正是這個趨勢的具體證明。報告特別拆分了「模型」與「Harness」兩塊評分,千問的勝利主要來自Harness——它會自動拆解任務、檢查數字對不對、發現問題重做。相比之下,其他工具在個別維度有短板。這代表過去「模型參數最大=最聰明」的時代已經過去,現在是「會做事的框架」才能贏。
第三個信號是隱私敏感度的上升。本機模型Qwen 3.8只要270億參數卻能打敗參數多28倍的云端旗艦,這讓「合約、病歷、客戶名單這類敏感資料也能在自己電腦上處理」成為可能。同時,虛擬網紅Janie用100美元、每天30分鐘生成百萬觀看,卻在被標為AI內容後觀看行為幾乎沒變。這暴露出「真實性」在注意力市場上已經不是必要條件,只是可有可無的加分項——企業和個人都開始重新評估什麼值得信任。
第四個信號是人類在AI工作流中角色的轉變。Claude Code讓非工程師用計畫模式先看方案再執行,Huzzah把程式碼改成從伪代碼生成(留下人的意圖檔案),這些工具的共同假設是:人的核心價值正在從「執行細節」遷移到「決策邏輯」。工程師也開始只維護伪代碼而非不斷重複描述需求,對話紀錄變成廢棄物,意圖檔案才是資產。
最後是職場知識結構的隱憂。Slack主張「知識全鎖在私訊時,AI代理就無用」,所以企業應把知識摊公開頻道。但這等於要求員工在全公司可見的地方討論薪資、戰略、個人意見,帶來隱私與權限的兩難。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


