KeyFrame內部研究專用

5 AI Tested: Which One Is Most Reliable and Which One Will Lead You Astray? | Peterson

彼得森·6月28日週日·17 min中文

三句話摘要

對比測試 5 個 AI 工具(ChatGPT、Gemini、Claude、Siri AI、Grok),從實用場景檢驗能力與幻覺問題。 不是 AI 越聰明越值得信任,而是越敢說「不知道」的 AI 越值得信任——Claude 因此成為日常可靠夥伴,ChatGPT 綜合強但需多重驗證,Siri AI 免費但暫未足夠,其他工具各有專項優勢。 幻覺差異明顯:ChatGPT 給錯資料(iPhone 18 規格)時最自信最詳細,Claude 則直接說「未知」,證明 AI 的確定度與準確度無關。

重點整理

重點
  • 1

    幻覺差異明顯:ChatGPT 給錯資料(iPhone 18 規格)時最自信最詳細,Claude 則直接說「未知」,證明 AI 的確定度與準確度無關。

  • 2

    使用體驗決勝:Siri AI 能直接發送訊息到聯絡人,其他四家都需手動複製貼上;GPT 有複製按鈕最便利,Gemini 卻把訊息混在說明裡。

  • 3

    服務整合差異大:Siri AI 與 Apple 生態整合最深(郵件、行事曆、聯絡人無需授權),但 Gemini 作為 Google 產品反而無法有效存取 Gmail 和 YouTube 資料。

  • 4

    實時資訊與過期資料:ChatGPT 和 Grok 查訂閱數最準(33.4 萬),Claude 給了過期資料但誠實標註不確定性,Gemini 竟查出兩年前的資料。

實用技巧與重點

乾貨
  • 測試項目與結果排名:
  • 圖片生成(生日賀卡):GPT>Gemini>Claude>Grok>Siri AI
  • 寫訊息體驗:Siri AI>GPT>Gemini>Claude/Grok
  • 查信箱:GPT>Claude>Siri AI>Gemini>Grok
  • 即時資訊:GPT>Gemini/Grok>Claude/Siri AI
  • 幻覺測試:Claude>Gemini>Grok>GPT>Siri AI
  • 具體發現數據:
  • iPhone 18 規格幻覺:GPT 虛編 60Hz 螢幕(實際應為 120Hz)、128GB 容量;Grok 精確虛編 3,692 mAh;Claude 不知道處寫「未知」
  • YouTube 訂閱數(正確:33.4 萬):GPT/Grok 33.4 萬、Claude 32 萬、Gemini 30 萬→13.4 萬(查到兩年前資料)
  • 平均評分:ChatGPT 4.2 星、Gemini 3.4 星、Claude 3.2 星、Siri AI 2.4 星、Grok 2.2 星
  • 工具與功能:
  • Siri AI:能直接發送訊息、存取 Apple Mail 無需授權
  • GPT:提供複製按鈕、訊息獨立框顯示
  • Gemini:Google 自家但 YouTube/Gmail 整合不佳

結論

結論

不是 AI 越聰明越值得信任,而是越敢說「不知道」的 AI 越值得信任——Claude 因此成為日常可靠夥伴,ChatGPT 綜合強但需多重驗證,Siri AI 免費但暫未足夠,其他工具各有專項優勢。

完整解析

詳細

這場測試透過五個日常場景揭露不同 AI 的優劣。第一個場景是生日賀卡生成,要求中文「生日快樂」並先改簡體再改繁體。ChatGPT 完美執行,Gemini 自作聰明加上「Birthday Girl」與年齡元素,Claude 因無法生成圖片改用程式碼簡筆畫,Grok 字跡錯亂,Siri AI 則放棄改正簡體字。

第二場景測試寫訊息體驗。五家 AI 的內容都尚可接受,但使用體驗天壤之別。GPT 提供複製按鈕最便利,Siri AI 能直接發送到聯絡人而無需應用切換,Gemini 卻把訊息和說明混在一起,Claude 與 Grok 需手動複製。另外值得注意的是,測試中故意打錯「世界盃」成「世界杯」,GPT、Gemini 與 Siri AI 自動改成繁體習慣用法,Claude 與 Grok 保留簡體字,後續還需手動修改。

第三場景檢驗郵件整合能力。Grok 根本無法連接信箱,Gemini 作為 Google 產品竟查到早已處理的舊發票,Siri AI 讀取了 Apple Mail 並指出沒有未處理帳單,Claude 找到實際帳單並清楚標註狀態,ChatGPT 則最意外地發現三封 Google 安全警示與可疑的 Drive 分享檔案,主動提醒釣魚風險。

第四場景是即時資訊查詢(世界盃比賽與 YouTube 訂閱數)。ChatGPT 用國旗視覺化最直觀,Gemini 用表格最清晰,Siri AI 呼出原生賽程卡但缺戰況分析,Claude 卻給出過期資料(南非還未追平)。訂閱數則 ChatGPT 與 Grok 查最準(33.4 萬),Gemini 竟查出兩年前的 13.4 萬,顯示 Google 對自家服務資料的存取有隱憂。

最後一個場景測試 AI 幻覺。要求 iPhone 18(尚未發表手機)的規格比較表。Siri AI 直接當真宣稱規格,Grok 虛編精確的 3,692 mAh 電池容量製造可信度,Claude 不確定處寫「未知」最負責,Gemini 保持克制多數合理,ChatGPT 則給出最詳細但最多錯誤的資料——虛編 60Hz 螢幕與 128GB 起步容量,明顯退步於 iPhone 17。這揭示一個悖論:AI 越詳細越自信,往往代表幻覺越多。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。