KeyFrame內部研究專用

How To Use Claude Code With Ollama (Free Local AI Setup)

Ksk Royal·6月28日週日·8 min英文

三句話摘要

在本機使用 Olama 執行 Anthropic Compatible API,用本地開源 AI 模型運行 Claude Code 進行開發。 本地運行 Claude Code 經由 Olama 的 Anthropic 相容層已成可行,關鍵是根據硬體挑選模型規模,並將 context window 提升至 64K 來充分發揮模型能力。 Olama 的 API 相容性突破:Olama 現已支援 Anthropic Compatible API 端點,讓 Claude Code 能直接呼叫本機執行的模型,打破雲端綁定的限制。

重點整理

重點
  • 1

    Olama 的 API 相容性突破:Olama 現已支援 Anthropic Compatible API 端點,讓 Claude Code 能直接呼叫本機執行的模型,打破雲端綁定的限制。

  • 2

    模型選擇與硬體匹配:Jammer 4 e2b(8GB 記憶體)提供 30-40 tokens/sec 的回應速度,Jammer 4 12b(13GB 記憶體)提供顯著更強的推理能力;Qwen 3.6 27b 適合 24GB 以上機器。

  • 3

    Context Window 是關鍵瓶頸:Olama 預設 8K tokens 的 context 遠不足以支持複雜編程任務,必須手動提升至 64K 才能讓 Claude Code 維持完整的對話歷史與任務指示。

  • 4

    模型規模影響輸出品質:2B 模型在跨多個檔案的 HTML/CSS/JavaScript 一致修改上失敗,12B 模型能正確分析根本原因並精準修復,凸顯參數規模對複雜推理的決定性影響。

實用技巧與重點

乾貨
  • 下載來源:olama.com
  • 推薦模型與需求:
  • Jammer 4 e2b:8GB RAM,30-40 tokens/sec
  • Jammer 4 12b:13GB RAM
  • Qwen 3.6 27b:24GB+ RAM
  • 必須設定:context length = 64K(在 Olama 設定中修改)
  • 啟動命令:透過 Olama 的指定頁面取得,會自動偵測並安裝 Claude Code CLI
  • 硬體:M4 MacBook Air 可運行,任何現代 Mac/Windows/Linux 都支援
  • MLX 優化版本:Apple Silicon 專用優化
  • 生成時間範例:3 分鐘建立完整待辦事項應用;4 分鐘添加暗黑模式功能

結論

結論

本地運行 Claude Code 經由 Olama 的 Anthropic 相容層已成可行,關鍵是根據硬體挑選模型規模,並將 context window 提升至 64K 來充分發揮模型能力。

完整解析

詳細

Olama 最近推出的 Anthropic Compatible API 支援,改變了本地開發者運行大型語言模型的方式。過去 Claude Code 只能透過雲端 API 執行,現在則能直接與執行在使用者機器上的開源模型溝通,既規避了隱私風險,也消除了 API 成本。

安裝流程簡潔明快:從 olama.com 下載適合作業系統的安裝程式,複製安裝命令貼到終端機即完成。Olama 啟動後駐留在工作列,用戶需進入模型庫選擇與硬體相匹的版本。對於 24GB 記憶體以上的機器,Qwen 3.6 27b 是頂級編碼模型;對於中等硬體,Jammer 4 系列(8GB 用 e2b、13GB 用 12b)是平衡點。Apple Silicon Mac 應優先下載 MLX 優化版本以發揮最大效能。

然而初期設置有一項關鍵卻容易忽視的步驟:Olama 預設的 8K context window 完全不足應付編程任務。在使用 Claude Code 前必須將其提升至 64K,讓模型保留完整的對話歷史與任務指示。演示中用 Jammer 4 e2b 建立待辦事項應用只需三分鐘,顯示小模型對簡單任務游刃有餘,生成速度達 30-40 tokens 每秒。

但當任務複雜度提升,問題隨之浮現。嘗試添加暗黑模式時,2B 參數模型無法同時在三個檔案(HTML/CSS/JavaScript)間保持邏輯一致,導致 UI 美觀度下降。此時升級至 Jammer 4 12b 展現了參數規模的實際影響:模型不只生成更好的代碼,更重要的是能正確診斷問題根源(CSS 規則未更新、JavaScript 切換邏輯衝突),然後應用精準的修復。雖然單次迭代耗時更長,但推理能力的跳躍式提升使得最終產物達到可用水準。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。