KeyFrame內部研究專用

Your Fine-Tuned Model Is Tech Debt: A 50x ROI House of Cards — Dan Bjornn, Lease End

AI Engineer·8月20日週四·16 min中文

三句話摘要

LLM 應用開發中微調 vs 提示工程的實戰對比:為什麼改用系統提示和技能架構效果更好。 在大多數商業場景中,投資優化系統提示、上下文設計和模型不可知架構,會比微調模型更高效、更經濟、更靈活。 RAG 方法的限制:早期使用工作流式 RAG 系統,雖然搜尋客戶訊息和相關職位,但無法有效處理複雜對話情境,經常出現邏輯錯誤(如誤觸發電話)。

重點整理

重點
  • 1

    RAG 方法的限制:早期使用工作流式 RAG 系統,雖然搜尋客戶訊息和相關職位,但無法有效處理複雜對話情境,經常出現邏輯錯誤(如誤觸發電話)。

  • 2

    微調的隱形成本:微調看似能解決問題,實則帶來「結晶化稅」—每修改一個問題就會引發其他連鎖問題,需要持續重新訓練,流程耗時一週且高度複雜。

  • 3

    技能與上下文才是關鍵:受 Claude Code 啟發,發現改用模型不可知的技能架構搭配系統提示,只需調整提示詞而非重新訓練,在保持靈活性的同時大幅提升準確度。

  • 4

    微調應該是最後手段:微調僅在三種特殊情況有效:需要離線運行、有嚴格隱私要求、或完全無法使用 API。其他情況都應先嘗試優化上下文和提示詞。

實用技巧與重點

乾貨
  • 產品收入:12 億美元資金,50倍 ROI
  • 時間改進:問題修復週期從 7 天 → 1 小時以內
  • 方法轉變:RAG → workflow-based → skills/tools/resources 架構
  • 支援模型:OpenAI、Anthropic、其他任何模型(模型不可知設計)
  • 部署方式:調整系統提示後,驗證效能 → 迭代 → 上傳 MD 檔案到 S3 部署
  • 成本影響:每條訊息 API 成本上升,但總成本下降(因省去微調開銷)

結論

結論

在大多數商業場景中,投資優化系統提示、上下文設計和模型不可知架構,會比微調模型更高效、更經濟、更靈活。

完整解析

詳細

這個案例源自一家用 LLM 協助客戶聯繫銷售團隊的公司。初期他們構建了工作流式系統,以向量資料庫儲存客戶訊息和相關職位,藉由檢索增強生成(RAG)提升回應精度。然而這個方法遭遇瓶頸:系統無法正確理解何時應該發起電話、何時應該延後、如何正確觸發提醒。典型的失敗例子是,LLM 在只應該發送「明天會聯絡」訊息時,卻自行決定立刻打電話給客戶。

面對這些問題,團隊最初的想法是使用微調來教會模型更精準的行為。微調確實改進了準確度並創造出實際業務價值(12 億美元資金)。但在運營過程中,他們發現微調帶來了難以管理的複雜性。每當他們修正一個問題,比如改正客戶訊息的發送邏輯,往往就會觸發其他領域的新問題。這種互相牽制的現象被稱為「結晶化稅」。這導致每週都得經歷完整的問題收集、數據準備、模型訓練、效能驗證的迴圈,耗時且成本高昂。

轉機出現在年中。講者注意到在使用 Claude Code 進行編碼任務時,改變 skills(技能)、resources(資源)和 context(上下文)往往比重新訓練模型更有效。受此啟發,團隊決定在自己的系統中套用類似理念。他們設計了一個模型不可知的代理框架,不再依賴模型微調,而是通過優化系統提示、構建專門的技能模組、並給予更精豐富的上下文來改進效能。具體做法是:發現問題 → 調整受影響技能的系統提示 → 在生產資料集上驗證效能 → 迭代幾次後,直接上傳 Markdown 檔案到 S3 完成部署。

這個重構帶來了三個量級的改善。首先,從發現問題到生產部署的時間從七天壓縮到不到一小時。其次,回應準確度大幅超越微調模型的表現。第三,他們終於獲得了模型選擇的自由—可以使用 OpenAI、Anthropic 或任何其他模型供應商,無需被鎖定在特定廠商的微調版本。唯一的權衡是每條訊息的 API 成本略高(因為使用了更強大的基礎模型),但因為省卻了微調基礎設施和持續維護的成本,總體運營成本反而下降。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。