KeyFrame內部研究專用

Which AI Is the Best for Academic Writing? ChatGPT Loses in a Brutal Showdown to "It"?

RYAN老師AI研究室·7月8日週三·9 min中文

三句話摘要

測試六款主流大型語言模型在學術論文討論章節寫作上的實際表現差異。 同一套嚴謹提示詞下,Deep Seek、Grok v4和Claude 4.6表現最優,但各模型各有優劣,應根據論文寫作的具體需求選用最適配的模型而非盲目追求單一標準。 --- 延伸提示:如您有興趣取得Ryan老師測試用的完整提示詞組,可在原影片下方留言「我要提示詞」,講者會一一回覆提供。 互動確認機制的重要性:提示詞設計應要求模型一段段確認內容而非全自動生成,確保生成結果符合研究需求,不同模型對此指令的遵循度差異大。

重點整理

重點
  • 1

    互動確認機制的重要性:提示詞設計應要求模型一段段確認內容而非全自動生成,確保生成結果符合研究需求,不同模型對此指令的遵循度差異大。

  • 2

    評分維度的多元考量:學術語氣、邏輯連貫性、內容準確度、指令遵循度、精簡程度等五大面向加權計分,可全面評估模型在論文寫作上的真實能力,比單純字數更具參考價值。

  • 3

    無絕對完美只有適配:沒有一款模型在所有維度都完美,各有強弱項(如Deep Seek互動詳細但字數冗長、Claude執行快但建議不足),應根據寫作階段的具體需求選擇最適合的工具。

  • 4

    防止模型幻覺的測試策略:提示詞刻意要求模型在IEEE期刊中查找文獻進行比較,以此檢驗模型是否會編造或幻覺內容,這是學術應用的關鍵安全檢查項。

實用技巧與重點

乾貨
  • 測試工具與平台
  • 使用平台:Fellow AI介面
  • 測試模型:GPT-4、Claude 4.6、Claude 4.3、Gemini 3.1 Pro、Grok v4 Pro、Kimi、Deep Seek
  • 測試流程(六階段提示詞)
  • 第一階段:確認研究主要缺口
  • 第二階段:從論文中提取相關內容
  • 第三階段:在IEEE期刊文獻中查找比較資料
  • 第四階段:提出論文局限性(limitation)
  • 第五階段:列舉未來研究方向(future research direction)
  • 第六階段:撰寫結論並生成綜合檢查報告
  • 評分維度與結果
  • | 評分項目 | 權重 | 評分方式 |
  • |---------|------|---------|
  • | 學術語氣 | 重點 | 用語是否符合學術規範 |
  • | 邏輯連貫性 | 重點 | 論述是否前後一致 |
  • | 內容準確度 | 重點 | 資訊是否正確無幻覺 |
  • | 指令遵循度 | 重點 | 是否按照互動流程進行 |
  • | 精簡程度 | 參考 | 是否避免冗長重複 |
  • 各模型生成字數
  • Deep Seek:920字(最多)
  • Grok v4 Pro:920字左右
  • Kimi:829字
  • Claude 4.6:728字
  • GPT-4:690字
  • Gemini 3.1 Pro:607字
  • Claude 4.3:439字(最少)
  • 最高分模型
  • 第一名:Grok v4 Pro(評分最高)
  • 第一名:Claude 4.6(評分最高)
  • 突出表現:Deep Seek(互動詳細、提供詳細寫作建議)

結論

結論

同一套嚴謹提示詞下,Deep Seek、Grok v4和Claude 4.6表現最優,但各模型各有優劣,應根據論文寫作的具體需求選用最適配的模型而非盲目追求單一標準。 --- 延伸提示:如您有興趣取得Ryan老師測試用的完整提示詞組,可在原影片下方留言「我要提示詞」,講者會一一回覆提供。

完整解析

詳細

Ryan老師在這支影片中直接對六款主流大型語言模型進行了一場學術寫作的實戰對決。他的測試方法非常嚴謹——使用Fellow AI介面作為統一平台,準備了一份真實已完成的論文草稿,並設計了一套固定的六階段提示詞專門用於論文討論章節的寫作。這套提示詞的核心特色是融入了互動確認機制,要求模型不是盲目自動生成,而是一步步與使用者確認每個環節的內容,確保生成結果真正符合研究需求。

測試過程中,Ryan分別在六個模型上執行完全相同的提示詞與草稿。值得注意的是,不同模型在執行互動確認指令時表現差異很大。例如GPT-4、Gemini、Deep Seek等會按照提示詞要求停下來與用戶確認,而Claude則直接全速生成中間沒有停留。他也特別設計了一個檢驗點——要求模型在IEEE期刊中查找文獻做比較,以此測試模型是否會產生幻覺或編造內容,這對於學術應用至關重要。

評分階段更體現了Ryan的專業度。他使用Gemini作為評審者,針對學術語氣、邏輯連貫性、內容準確度、指令遵循度和精簡程度等五個維度進行加權評分。有趣的是,Gemini對自己生成的稿件並沒有作弊給高分,反而給了相對客觀的評價。最終結果顯示,Grok v4 Pro和Claude 4.6的評分最高,Deep Seek雖然字數最多且提供最詳細的寫作建議與互動確認,但內容的精簡度稍遜。不同模型各有優勢——Deep Seek在互動與建議上突出,Claude在執行效率上快速,Grok在綜合評分上領先。

這個比較的核心啟示是:沒有絕對完美的AI模型,只有最適合當前寫作階段的超級助手。研究者應該根據自己的具體需求——是需要詳細的互動指導還是快速的初稿生成,是追求字數充足還是內容精煉——來選擇對應的工具,這才是在學術研究中彎道超車的關鍵。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。