KeyFrame內部研究專用
每日

今日 KeyFrame

管線分析的每一部影片,最新的優先。每張卡片都直接連回原始影片。

6月19日星期五

30
What Happens When GPT, Claude, and Gemini Rank Each Other Blindly?
10 min
AI 技術英文6月19日

What Happens When GPT, Claude, and Gemini Rank Each Other Blindly?

Prompt Engineering

  • 議會架構分三階段運作:每個模型獨立作答 → 互相盲排名並計分 → 主席模型(Opus 4.8)綜合所有回應產出最終答案並標記共識與分歧,理念來自傳統機器學習的 Ensemble 方法——多個弱學習器合力勝過單一強學習器。
  • 角色分工是關鍵設計:給每個模型不同的人格設定(第一性原則記者、嚴格推理師、紅隊懷疑者等),目的是讓它們不要收斂到相似答案,主席也被要求浮現分歧而非將所有意見磨平成一鍋粥。
  • 測試結果出乎意料:議會只在「開放式設計問題」中勝出,在「權衡取捨題」和「風險題」中輸了,在「事實題」上因為所有強模型都答對而無差異——顯示議會是判斷工具,不是計算器。
Agentic AI Explained: The Complete 2026 Guide
30 min
AI 技術英文6月19日

Agentic AI Explained: The Complete 2026 Guide

Aishwarya Srinivasan

  • 1. 不可預測性來自機率採樣,溫度(Temperature)是控制旋鈕
  • LLM 每次生成時對所有可能的 token 計算機率分布,再依機率採樣而非直接選最高分,這就是為何同一問題會得到不同回答。Temperature 越低輸出越穩定,越高則越發散,這是設計特性而非缺陷。
  • 2. Decoder-only 架構統一了理解與生成
I Made an AI Character Sit With Me and Have a Conversation (Full Tutorial)
18 min
AI 技術英文6月19日

I Made an AI Character Sit With Me and Have a Conversation (Full Tutorial)

Prompt Mastery

  • 解析度匹配是整個流程的核心約束。 Scale 2 的動作轉移要求輸入影片與輸出影片解析度完全相同,一旦不匹配角色邊緣就會模糊或錯位;這也是放棄 12GP 內建工作流而改用 ComfyUI 的唯一原因——只有 ComfyUI 能設定任意自訂解析度(768×1088)。
  • 「Solo Method」讓一個人能同時扮演兩個角色。 若沒有助手協助動作捕捉,可架好攝影機坐在左椅說話、再坐右椅說話,剪輯軟體左右拼接後,取其中一側作為驅動影片輸入 Scale 2,即可完成角色替換。
  • OmniVoice + LTX 2.3 組合實現了精準的音訊驅動控制。 OmniVoice 先從網路素材複製目標語音,LTX 2.3 再根據音訊與提示詞生成角色影片,使口型、表情與動作完全跟隨聲音,解決了傳統生成影片缺乏靈魂感的問題。
Day 5 - Google AI Agents Intensive Vibe Coding Course 2026 | Production Grade Development
16 min
AI 技術英文6月19日

Day 5 - Google AI Agents Intensive Vibe Coding Course 2026 | Production Grade Development

RK Tech Edge

  • 付費帳號是硬性門檻:Agent-to-Agent Runtime 部署需要 Google Cloud 訂閱帳號,一般免費帳號無法執行,講者借用朋友帳號完成示範。
  • Spec-Driven 開發流程貫穿全程:AI Agent 根據規格(Spec)自動生成應用、實作、測試、發現問題後自動修正再重新發布,展示了規格驅動開發的完整閉環。
  • 模型選擇影響資源消耗:Opus 能力優於 Sonnet,但消耗 credit 更快;在資源有限情況下,講者改用 Sonnet 以維持課程進行。
AI News: Fable Banned, New Open-Source Leader, Midjourney Shocker
35 min
AI 技術英文6月19日

AI News: Fable Banned, New Open-Source Leader, Midjourney Shocker

Matt Wolfe

  • 1. Anthropic 自食其果的監管困局
  • Dario Amodei 曾多次公開主張 AI 模型具有危險性、政府應有權暫停模型發布;美國政府隨後以出口管制為由要求下架 Fable 5 與 Mithos 5,Anthropic 因無法精準分離地區用戶,被迫對全體用戶一律下架——自己的倡議反過來約束了自己,同時也揭示了 AI 公司面臨政府干預的新型系統性風險。
  • 2. 開源模型在性能與成本雙線追趕閉源前沿
砸16万接盘外卖店,每天狂干15小时只挣80块?深圳36岁宝妈算完账崩溃了
29 min
企業管理中文6月19日

砸16万接盘外卖店,每天狂干15小时只挣80块?深圳36岁宝妈算完账崩溃了

勇哥餐饮创业笔记

  • 帳目不清是最大盲區。 店主把個人花費與店鋪收支混在一起,從未釐清到底盈虧幾何。勇哥強調,一切優化動作的前提是把每一項細帳算明白,否則方向都是錯的。
  • 廣告投入侵蝕了真實利潤。 毛利率40%、日營業額1,100元,看似有利潤,但每日還要額外支出80元廣告費,實際日淨利僅約80元,等於每月只賺2,400元左右,遠低於感知。
  • 產品線過窄限制了增長天花板。 目前爆款僅有黑糖老薑茶與雞蛋水,且姨妈熱飲族群單一,復購率低。勇哥建議加入廣東糖水或搭配糕點,以組合套餐方式提升客單價,同時擴大受眾覆蓋面。
This AI Agent Runs My Social Media Marketing (here’s how)
7 min
AI 技術英文6月19日

This AI Agent Runs My Social Media Marketing (here’s how)

Skai Generated

  • 品牌資產優先注入:在生成任何內容前,先將品牌全資產文件上傳至聊天,讓 AI 徹底了解品牌個性與產品細節,避免靠猜測產生偏差內容。
  • 跨產業移植比優化競品更有力:直接模仿競品只是複製,真正的突破來自借鑑完全不同產業的成功邏輯。影片中將 Red Bull Stratos 的「極限挑戰規則」框架移植到鞋品牌,推導出「Rule Breaker 給你翼」的差異化定位。
  • 計畫即可執行的素材,而非靜態文件:30 天計畫每一天都直接對應具體貼文類型、腳本、字幕與發布時段,讓計畫能直接轉化為製作動作,而非留在規劃層。
水音世界观--6月19日--伊朗暂停与美国的谈判行程,伊朗声明60天内免除霍尔木兹海峡通行费
57 min
AI 技術中文6月19日

水音世界观--6月19日--伊朗暂停与美国的谈判行程,伊朗声明60天内免除霍尔木兹海峡通行费

水音世界观

  • 以色列是美伊談判的結構性破壞者:以色列深知一旦美伊和解,美國扶持以色列的地緣理由將消失,內塔尼亞胡的極右翼執政聯盟也將瓦解,因此精準踩踏伊朗底線,出兵黎巴嫩逼使伊朗依據備忘錄第一條款退出談判,屬於蓄意搅局而非誤判。
  • 伊朗內部保守派從未真心支持協議:伊朗最高領袖穆杰塔巴原則上不認可備忘錄,僅給世俗派總統佩泽西希扬一次試水機會,以色列開火等於送上伊朗有理有據退場的台階,伊朗在道義、底線、輿論三方面全部佔優。
  • 特朗普管不住盟友,談判缺乏公信力:特朗普推動談判的動機是收割政績與國際名聲,但因受制於國內猶太遊說集團,無法實質制裁以色列,導致備忘錄簽署後不到24小時即形同廢紙,最終竹籃打水。
How People Analytics Help Solve HR and Talent Management Challenges
21 min
AI 技術英文6月19日

How People Analytics Help Solve HR and Talent Management Challenges

TalentCulture - World of Work

  • 能力、負荷、公平是最急需數據支撐的三大 HR 主題。 AI 技能只是能力議題的表面,更深層的問題是如何為各類職位的員工設計技能發展路徑;而員工心理健康與照護責任所導致的工作負荷問題,以及年輕世代對企業公平透明度的期待,都尚未被數據有效覆蓋。
  • AI 將 HR 分析從「找報表」進化為「問答式洞察與根因追蹤」。 過去分析師需要知道去哪個儀表板、看哪張圖,AI 現在能直接回答問題、生成敘述解釋、並引導使用者一步步找到 KPI 異常的根本原因,最終給出行動建議。
  • 數據讓 HR 從感性決策轉向科學驗證,甚至能推翻長期存在的管理迷思。 「銷售員不需要訓練」這類說法過去無從挑戰,但透過分析工具可量化訓練對客戶獲取率與營收的實際影響,用數字讓假設接受檢驗。
Why Startups Struggle to Get Initial Traction
34 min
企業管理英文6月19日

Why Startups Struggle to Get Initial Traction

PitchXPO

  • 零信任品牌的GTM必須從「借用信任」開始,而非直接規模化推廣。 Scott Finkel指出,應聚焦單一痛點、單一目標族群、單一可信渠道與單一驗證循環,讓市場透過它已信任的機構認識你,因為沒有信任基礎就無法成長。
  • 線下市場的核心決策是差異化定位與資本效率,而非快速鋪店數。 Sorjendu強調先確認差異化點,再做5-10個試點測試地理與人口組合,每日追蹤數據,找到有效模型後才規模複製;Annie補充,線下業務試錯成本遠高於線上,善用「搭便車策略」與既有合作夥伴能大幅降低風險。
  • 選址(Location)是線下GTM中最常被忽視的關鍵變數。 Nehul引用Kotler的行銷理論,強調該地點是否有競爭、是否有足夠消費力、流量來源是什麼,直接決定廣告投放策略;線下單一中心的行銷應聚焦在服務半徑內,而非無效地向全城投放。
how many businesses can you run effectively at once?
39 min
企業管理英文6月19日

how many businesses can you run effectively at once?

Nick Saraev Daily Updates

  • 1. 報價的精確性決定承諾的實際標準
  • Ashton 的報價「三到五個預約」在合約層面等同於三個,因為只要達到下限就算履約。講者建議直接給單一具體數字(如 20 個),才能讓報價對客戶產生真實的說服力,並讓自己有清楚的執行目標。
  • 2. 自動化的定價依據是「你幫客戶創造多少價值」
Etsy Advice that Might be Killing Your Shop in 2026
14 min
企業管理英文6月19日

Etsy Advice that Might be Killing Your Shop in 2026

heatherstudio

  • 標題關鍵字堆砌已無效:Etsy 的標籤(tags)才是真正負責搜尋排名的機制,標題應精簡、像人寫的,並使用具體的長尾詞組(如 "gift for Corgi mom")而非籠統形容詞,這樣能降低買家困惑、提升點擊意願。
  • 運費定價直接影響能見度:Etsy 目前偏好運費低於 6 美元的商品。對利潤空間足夠的產品(如毛毯,利潤約 15–20 美元、利潤率 40–50%)可提供免運費;若無法免運,則將運費壓低至 5–5.3 美元並相應調整售價,短期小虧換取長期排名提升。
  • 展示圖不可重複使用:Etsy 演算法現在懲罰看起來「千篇一律」的店鋪。解法是準備 3 張帶有店家浮水印的核心展示圖,每個新商品輪流使用,並每 6–12 個月更換一輪模板。
Marketing & Sales Strategy for Service Based Business (PROVEN & PROFITABLE)
15 min
企業管理英文6月19日

Marketing & Sales Strategy for Service Based Business (PROVEN & PROFITABLE)

Daron Pacheco

  • 目標訊息(Destination Messaging):服務供應商的常見錯誤是宣傳方法與流程,而非客戶最終想要的結果。客戶購買的是「六個月後更健康、更有自信的自己」,而不是訓練計劃本身,訊息必須讓客戶能把自己投射到那個終點。
  • So What 法則:每次列出服務功能或配置後,必須立即回答客戶心中的問題「這對我有什麼用?」把功能翻譯成具體個人利益,才能讓客戶看見自己從中受益,銷售過程也從說服變成確認。
  • ACES 漏斗系統:再好的訊息若沒有結構化系統支撐,就是把內容投進黑洞。ACES 六步驟建立一條清晰路徑,讓完全不認識你的人,透過自然的信任建立過程,主動成為你的客戶,整個過程沒有追逐、沒有壓力。
13 Business Finance Lessons for Small Business Owners (Before It's Too Late)
14 min
企業管理英文6月19日

13 Business Finance Lessons for Small Business Owners (Before It's Too Late)

BizMoney Explained

  • 需求優先於採購:成功的創業者在大量進貨前先測試市場需求——收預訂、做小批量測試——避免資金凍結在無人問津的商品上。市場確認才是投資的起點,不是熱情。
  • 利潤是決策的產物,不是運氣:兩家公司可以有相同營收但利潤天差地別,差異在於毛利管控、高價值客戶的聚焦,以及持續追蹤「錢在哪裡賺、在哪裡流失」的財務紀律。
  • 客戶留存優於客戶獲取:現有客戶已建立信任、購買門檻低、終身價值高,且口碑效應強;相比之下,獲取新客戶成本更高、轉換不確定性更大,應優先設計讓舊客戶回購的機制。
ABM Strategy in 2026: Giving Sales the "Who" Behind the “What” | VertoTalks On-Air #7
52 min
企業管理英文6月19日

ABM Strategy in 2026: Giving Sales the "Who" Behind the “What” | VertoTalks On-Air #7

VertoDigital

  • 帳號訊號掩蓋了真實買家:當 ABM 工具顯示 Adobe 有購買意圖,SDR 面對的是 500 個潛在聯絡人卻不知從何下手,結果只能發送通用群發信或直接忽略訊號,導致行銷 KPI 亮眼但實際營收毫無關聯。
  • 購買決策由人做出,不由帳號做出:B2B 買群(Buying Group)動輒 10-30 人,大量決策者從未出現在銷售通話中,行銷若只在帳號層級操作,永遠無法觸及這些隱形影響者,而他們的立場直接決定交易能否推進。
  • 聯絡人層級資料打通行銷與業務的鴻溝:將廣告曝光、點擊事件以時間軸形式寫入 CRM,業務在 Salesforce 中可直接看到哪些聯絡人已被暖身、暖身到什麼程度,自然主動挑選這些熱名單,不需要行銷反覆說服。
與Son對話 | Samuel Chan 陳思銘 | 英式教育改變一生|家教、價值觀同AI時代生存法則🧠 | 張慧敏 | 職場慧眼 | 中文字幕 (AI自動)
87 min
企業管理中文6月19日

與Son對話 | Samuel Chan 陳思銘 | 英式教育改變一生|家教、價值觀同AI時代生存法則🧠 | 張慧敏 | 職場慧眼 | 中文字幕 (AI自動)

張慧敏Son姐話

  • 1. 環境與制度,而非努力,是逆轉的根源。
  • 陳思銘在香港讀屋邨學校長期處於班底,進步了無人鼓勵,自信越來越低。到英國後,小班教學讓老師記得每個學生,體育是必修課,Sports 培養出 teamwork、溝通與 emotional control,這些是香港考試制度根本不提供的土壤。
  • 2. 寄宿教育買的是「獨立」,不是英國課程。
The Hidden Reason Anthropic Wants to Slow Down AI
15 min
AI 技術英文6月19日

The Hidden Reason Anthropic Wants to Slow Down AI

The Infographics Show

  • 安全倡議與商業利益的矛盾:Anthropic 在 IPO 前夕發布 AI 失控警告,呼籲全球同步暫停,但條件是「所有主要實驗室同時同意」——這個幾乎不可能達成的條件,確保了自身在等待期間繼續加速開發,同時讓競爭對手在輿論壓力下受到制約。
  • AI 自我複製代碼的加速臨界點:2025 年 2 月 Claude Code 推出前,AI 撰寫的代碼占比僅個位數;15 個月後已超過 80%。Jack Clark 公開預測 2028 年將達到 100%。Claude 在 2026 年 4 月單月完成超過 800 項修復,將某類系統錯誤降低 1000 倍,這是人類團隊可能需要數年才能完成的工作量。
  • 監管即護城河:Anthropic 的「負責任擴展政策」定義了「能力門檻」,一旦被採納為行業標準,只有最頂層的實驗室能通過測試、承擔合規成本。Meta 首席科學家 Yann LeCun 與 AI 顧問 David Sacks 均直接指控 Anthropic 利用恐懼敘事塑造對自身有利的監管環境,將較小的競爭者排除在外。
GLM 5.2: NEW Opensource KING IS BEATING GPT-5.5 & Opus 4.8! (Fully Tested)
13 min
AI 技術英文6月19日

GLM 5.2: NEW Opensource KING IS BEATING GPT-5.5 & Opus 4.8! (Fully Tested)

WorldofAI

  • GLM 5.2 是目前最強的開源前端生成模型,在 Web Design 基準上排名第一,超過 Fable 5,且 Elo 達 1300,這是此前開源模型從未達到的水位。
  • 成本優勢是其核心競爭力,相同任務下 GLM 5.2 只需 $6,而 Claude Opus 4.8 需 $50,成本差距超過六倍,且速度更快,使其在商業應用場景具備明確優勢。
  • 能力提升幅度顯著,相比前代 GLM 5.1,在深度推理提升 46.2%,並在 Frontier Suite 綜合評測中達到 Opus 4.8 的 74.4%,在 Terminal Bench 與 SWE-bench Pro 上也接近或超越多個閉源模型。
This Open Source Repo Solves Claude Code's Biggest Problem
10 min
AI 技術英文6月19日

This Open Source Repo Solves Claude Code's Biggest Problem

Chase AI

  • Claude Code 天生愛寫冗餘程式碼:Claude Code 習慣重新造輪子,即使標準函式庫或平台已有現成功能,它仍傾向自行實作,導致 Token 消耗與程式碼量膨脹。
  • Ponytail 的核心策略是「強制懶惰」:透過六步驟提示流程,依序確認功能是否已存在於標準庫、原生平台或已安裝依賴中,只有全部否定才允許新寫程式,且要求寫最少可運作的版本。
  • 越強大的模型效益越顯著:Haiku 4.5(小型模型)本身已較精簡,Ponytail 在部分測試中反而讓其成本增加 21%;但 Opus 4.8(大型模型)因本身冗長,Ponytail 的壓縮效果更為突出,成本降幅達 53%。
GitHub Trending Today - astrid, mcp-server-cloudflare, ai & More | #90
16 min
GitHub 熱點英文6月19日

GitHub Trending Today - astrid, mcp-server-cloudflare, ai & More | #90

GitHub Trending Digest

  • AI 框架走向 microkernel 設計:Astrid 採用類 Linux 的微核心架構,核心固定、外部模組可替換,讓開發者能混搭不同 AI 供應商與工具,避免整個專案被單一平台綁死。
  • MCP 成為 AI 與基礎設施的橋樑:Cloudflare MCP Transporter 將 Model Context Protocol 落地,讓 Cursor 或 Claude 等 AI 客戶端直接操作 Cloudflare 帳戶,實現自然語言管理雲端資源的工作流。
  • 供應商無關的 AI SDK 是前端整合的關鍵:Sandstack AI 提供統一 API,讓同一套邏輯能切換 OpenAI、Anthropic、Gemini 等供應商,並原生支援 React、Vue、Svelte、Solid,降低多平台適配成本。
Learn 97% of DeepSeek AI in 11 Minutes
10 min
AI 技術英文6月19日

Learn 97% of DeepSeek AI in 11 Minutes

Parker Prompts

  • 模式選錯是最常見的失誤:用 Instant 模式處理複雜分析,就像用計算機解微積分,效果自然差。Expert 模式給出更完整推理結構,DeepThink 模式則完整展示 Chain of Thought,讓使用者能追蹤並驗證推理邏輯。
  • 同一對話可混搭模式:在 Expert 模式寫出程式碼後,不需離開對話,直接切換到 DeepThink 讓模型逐步檢查自己剛寫的邏輯,往往能發現第一輪遺漏的問題。
  • 上下文品質決定輸出品質:模型的回答品質直接取決於你餵入的資料量。空手問市場策略,得到通用建議;上傳 Q1 業績數據、競品報告、產品簡介後問同樣的問題,回答會指向具體數字、競爭威脅與定位建議。
How to Use GLM 5.2 For Free (Z.ai Open Source AI)
3 min
AI 技術英文6月19日

How to Use GLM 5.2 For Free (Z.ai Open Source AI)

Jigs Dev

  • GLM 5.2 以開源模型挑戰閉源旗艦:在 SWE-Bench PRO 上得分 62.1,超過 GPT-4.5 與 Gemini 2.5 Pro,顯示開源模型在程式碼能力上已具備頂級競爭力,且無需付費訂閱。
  • 低成本 API 是核心優勢:相較於閉源模型,GLM 5.2 的 API 定價極低,適合開發者在不超支的情況下於產品中整合前沿推理能力。
  • HuggingFace Router 提供統一接入點:透過 `https://router.huggingface.co/v1` 作為 base URL,搭配 HuggingFace token,可將任何支援 Chat Completion 的開源模型直接接入 VS Code AI Chat,無需額外部署。
Where AI Is Heading in 2026  Agentic AI, MCP, LLM Gateways & The Future of Work
6 min
AI 技術英文6月19日

Where AI Is Heading in 2026 Agentic AI, MCP, LLM Gateways & The Future of Work

AIRichly

  • 生成式 AI 是基礎,而非終點。 LLM 讓 AI 能寫作、生成程式碼、自然溝通,但這只是下一階段的地基,企業正在此之上構建更自主的系統。
  • MCP 是 AI 真正「動起來」的關鍵。 Model Context Protocol 讓 AI 與外部軟體工具整合,使其從被動問答者變成能主動採取行動的執行者,這是 2026 年最重要的 AI 趨勢之一。
  • 多代理系統將重塑企業工作流。 單一代理接收需求、另一個撰寫程式、第三個測試、第四個除錯——專業化代理協作可覆蓋完整業務流程,形成混合人機團隊。
USE GLM 5.2 for FREE in OpenCode (CloudFlare Workers AI Tutorial)
5 min
AI 技術英文6月19日

USE GLM 5.2 for FREE in OpenCode (CloudFlare Workers AI Tutorial)

Ksk Royal

  • 免費額度足夠日常測試:Cloudflare Workers AI 每日提供 10,000 tokens 免費,超量後可升級付費方案,但一般開發測試不需付費。
  • 設定流程以 API Token 為核心:連接 OpenCode 與 Cloudflare 需要兩個憑證——Workers Account ID 和自建的 API Token,缺一不可,這是確保安全存取的標準做法。
  • GLM5.2 具備完整 Agentic 能力:影片強調 GLM5.2 是目前開源模型中最強的 Agentic 模型之一,能自主規劃、建立檔案並撰寫完整應用程式,而非僅做程式碼補全。
Is this the BEST Open Source Model?
8 min
AI 技術英文6月19日

Is this the BEST Open Source Model?

AI BrainBox

  • 開源模型首次真正威脅閉源頂尖模型: GLM 5.2 是第一個在 Terminal Bench 2.1 突破 80% 門檻的開源模型(得分 81),代表開源社群在實際工程能力上首次達到可與 OpenAI、Anthropic 抗衡的水準。
  • MoE 架構搭配 Index Share 技巧使超長上下文可行: 模型總參數 7530 億,但每次僅啟動約 400 億,加上「Index Share」機制在每四個稀疏層共用同一注意力索引,使百萬 token 上下文的每 token 計算量降低近三倍,讓超長窗口不只是行銷數字。
  • 完全開源帶來隱私與自主控制: MIT 授權意味任何人皆可下載、自行部署、微調並商用,不受單一公司定價或存取限制;然而若使用 z.ai 官方 API,資料仍會流經中國伺服器,有資料主權需求者應選擇自架或 OpenRouter 等西方節點。
Industrial AI in Action | Roland Busch Keynote | VivaTech 2026 Paris
45 min
AI 技術英文6月19日

Industrial AI in Action | Roland Busch Keynote | VivaTech 2026 Paris

Siemens

  • 工業 AI 的核心要求是「零幻覺」可靠性。 消費端 AI 允許偶爾出錯,但控制生產線、電網、物流的 AI 一旦產生幻覺即造成真實損失,因此 Siemens 強調工業 AI 必須從一開始就內嵌於工程系統,而非事後疊加。
  • 數位孿生是工業 AI 的起點與驗證機制。 透過物理仿真建立機器、工廠乃至整個物流網絡的虛擬複本,企業可在花費任何實體成本之前完整壓力測試設計,Digital Twin Composer 更可將多個孿生體串接為一套整合模擬。
  • Eigen Engineering Agent 代表自主工程的新典範。 它不是提供建議的聊天機器人,而是在 TIA Portal 內自主規劃、蒐集文件、撰寫並驗證可執行控制碼,直到編譯無誤為止,同時能讀懂電氣設計圖紙並遵循企業自有的工程規範框架。
ChatGPT 健康升級答案勝過醫師|新創公司宣稱突破 LLM 注意力瓶頸|AI 散步日記每日 AI 新聞彙整 0619
30 min
AI 技術中文6月19日

ChatGPT 健康升級答案勝過醫師|新創公司宣稱突破 LLM 注意力瓶頸|AI 散步日記每日 AI 新聞彙整 0619

AI 散步日記

  • AI 醫療資訊有用但有責任灰色地帶
  • GPT 5.5 Instant 在健康問答的錯誤率、清晰度、完整度均聲稱勝過真人醫師,但測試由 OpenAI 自行執行,缺乏第三方驗證。AI 擅長整理資訊、釐清就醫方向,但無法替代聽診、病史判斷,出錯責任也以「僅供參考」規避,緊急症狀仍不可依賴。
  • 「AI 讓你快了,卻讓團隊慢了」是職場核心陷阱
Exciting AI Updates Weekly - June 19, 2026
23 min
AI 技術英文6月19日

Exciting AI Updates Weekly - June 19, 2026

Lev Selector

  • Claude Fable 5 的政治困局:模型發布後因Amazon CEO Andy Jassy向川普政府示警稱其可能遭越獄利用,行政命令要求Anthropic封鎖外國存取,最終連美國境內使用也被暫停,顯示AI模型已進入地緣政治管制範疇。
  • 模型融合(Fusion)是降本提效的關鍵路徑:Fusion技術允許同時調用多個便宜模型(如Gemini Flash、Kimi、DeepSeek),將其輸出合併為單一高品質回應,實測成本比Claude Fable 5更低且準確率更高,代表「用組合取代旗艦」成為可行策略。
  • Agentic/Loop工程是現代AI應用的核心架構:現代LLM不再只是單次預測Token,內部已內建「理解→規劃→執行→驗證→輸出」的迴圈邏輯;Agent Engineering作為新興職能,涵蓋目標定義、流程控制、工具整合、LLM-as-Judge品質驗證及可觀測性設計。
Scientists Found A Better Language For AI Agents
6 min
AI 技術英文6月19日

Scientists Found A Better Language For AI Agents

Two Minute Papers

  • 多代理人協作的根本問題是語言轉換浪費:現有架構中每個代理人必須將思維轉成完整英文文字,下一個再讀取,這既耗費 token 又引入語義損失。
  • 潛在向量通訊取代自然語言:研究提出讓代理人直接傳遞「純數值向量」給下一個代理人,不經文字轉換,AI 本就在潛在空間中思考,無需繞道人類語言。
  • 準確率顯著提升,成本大幅下降:在數學問答任務上準確率從 73% 升至 86%,且 token 用量減少 50–75%,以更低成本達到更好效果。
China's New Open Source Model Beats Claude Opus 4.8 🤯
56 min
AI 技術英文6月19日

China's New Open Source Model Beats Claude Opus 4.8 🤯

Bad Decisions Studio

  • Midjourney Medical 顛覆醫療影像
  • Midjourney 創辦人 David Hull 親自製作示範影片,展示以超聲波技術取代 MRI 的全身掃描裝置。傳統 MRI 昂貴、不舒適且需使用造影劑,而該設備目標是讓掃描變得便宜、快速、無創,進而使人們能夠定期進行預防性全身檢查,在問題發生前即早發現。
  • ChatGPT Codex 「錄製與重播」降低自動化門檻