KeyFrame內部研究專用

Stanford's Method Turns Claude Into a PHD Level Research Team

Nate Herk·6月29日週一·12 min英文

三句話摘要

介紹 Stanford STORM 研究方法在 Claude Code 中的實現,透過多角度代理驗證生成高質量研究報告。 STORM 方法的核心價值不在於該特定技能本身,而在於「多角度視角相互驗證能產生更全面、可信的研究」這一原則,鼓勵使用者透過代理協議建立專家委員會,主動識別與消除知識盲點。 多角度研究消除盲點:單一提示會遺漏關鍵視角,STORM 透過五個獨立人格(從業者、學者、懷疑論者、經濟學家、歷史學家)平行運行,各自找出其他視角遺漏的問題,最終合成更全面的結論。

重點整理

重點
  • 1

    多角度研究消除盲點:單一提示會遺漏關鍵視角,STORM 透過五個獨立人格(從業者、學者、懷疑論者、經濟學家、歷史學家)平行運行,各自找出其他視角遺漏的問題,最終合成更全面的結論。

  • 2

    可信度量化與驗證機制:報告中每項發現都標示可信度等級,並註明哪些視角支持或質疑該觀點;之後六個驗證代理會逐一檢查每項事實與來源的一致性。

  • 3

    高度可定制的輸出格式:STORM 技能不只是資料堆砌,而是產出一致的 HTML 報告,使用者可根據自身背景客製化報告焦點、新增額外視角(如顧客視角、基層員工視角),使輸出更符合實際決策需求。

  • 4

    次代理 vs 代理隊伍的成本差異:STORM 運用次代理(五個獨立代理向主會話彙報,互不溝通),比代理隊伍(可彼此對話辯論)成本低許多,但仍能透過後續合成與驗證階段達到高品質結論。

實用技巧與重點

乾貨
  • STORM 論文結論:生成文章組織度比次優方法高 25%
  • 五個研究視角:Practitioner(從業者)、Academic(學者)、Skeptic(懷疑論者)、Economist(經濟學家)、Historian(歷史學家)
  • 報告結構元素:60 秒摘要、按可信度排序的發現、風險控制、缺失視角分析、可操作的結論
  • 可信度標示例:「Reliability High, 9/10」、支持來源、質疑來源的明確列舉
  • 驗證流程:V2 版本在報告底部標註每項來源為「Confirmed(確認)」「Corrected(更正)」或「Demoted(降級)」
  • 成本效益對比:STORM 使用約 12 個代理,Deep Research 超過 100 個代理;STORM 更快、成本低 100%
  • 技能安裝位置:Claude 需放在 .claude 資料夾;其他工具可放 .codex、.agents 等相應資料夾
  • 使用者背景範例:講者身為 AI 教育工作者,可客製化報告角度為「內容創作者」或「AI 初學者」視角
  • Codex 模型評估:相比 Deep Research,HTML 簡報在「證據品質、來源多樣性、論題強度、可操作性、風險控制、視頻內容適配」六項全勝
  • 資源提供:技能檔、HTML 報告模板在免費學習社群內提供

結論

結論

STORM 方法的核心價值不在於該特定技能本身,而在於「多角度視角相互驗證能產生更全面、可信的研究」這一原則,鼓勵使用者透過代理協議建立專家委員會,主動識別與消除知識盲點。

完整解析

詳細

Stanford 研究團隊開發的 STORM(Synthesis of Topic Outline through Retrieval and Multi-perspective question asking)方法已被同儕審查證實能產出組織度高 25% 的文章。講者將此方法的核心原則融入 Claude Code 技能中,並免費分享給社群。

傳統單一提示的研究存在結構性盲點——一個視角無法涵蓋複雜議題的全貌。STORM 的解決方案是同時啟動五個獨立的專家代理,分別代表從業者、學者、懷疑論者、經濟學家與歷史學家。各代理獨立進行網路搜尋與分析,此後主會話進行「矛盾對應」階段,識別五個視角的分歧點、評估哪些有證據支撐、哪些證據薄弱。接著進行合成與同儕審查,由六個驗證代理逐一檢查每項事實與引用來源的真實性,最後產出一份統一的 HTML 報告。

與 Claude Code 原生功能 Deep Research 相比,STORM 技能展現顯著優勢。Deep Research 會同時啟動 100+ 個代理並在後台進行密集搜尋,最終產出簡單的 Markdown 檔案,內容是資訊堆砌、來源稀少、問題未解。講者用同一題目測試兩個方法,Codex 評估系統在「證據品質、來源多樣性、論題強度、可操作性、風險控制、媒體適配」六項標準中,均判定 STORM 的 HTML 簡報更優。更重要的是,STORM 只需約 12 個代理、成本更低且執行速度更快,避免了 Deep Research 可能觸發的 API 速率限制問題。

STORM 技能的實作方式簡潔:使用者只需在 Claude 中執行「/storm research」命令並提供研究主題,系統會自動執行完整的四階段流程。每份報告都採用一致的 HTML 範本,包含 60 秒摘要、按可信度排序的發現(如「9/10 可信度,學者與懷疑論者支持,從業者與經濟學家質疑」)、缺失視角分析、風險控制與可操作結論。報告來源在驗證後會被明確標記為「確認」「更正」或「降級」,增強用戶信心。

講者強調,此技能可根據使用者身份客製化。例如身為 AI 教育工作者的他,可在五個基本視角外新增「初學者視角」或「內容創作者視角」,使報告更契合業務需求。更廣泛的啟示是:當自身缺乏領域專業時,可透過代理團隊「借用」不同專家視角,讓多個獨立專家帶著各自的知識與背景為你服務,從而補足知識盲點。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。