KeyFrame內部研究專用

Run Your Own AI? 🦙 Full Ollama Setup + Practical Agentic AI

Wanderloots·6月25日週四·15 min英文

三句話摘要

如何使用 Ollama 在本機電腦執行開源 AI 模型,實現完全私密的本地 AI 助手。 Ollama 讓任何人都能在三分鐘內擁有私密、零成本且完全可控的本地 AI,並透過簡單端點對接外部工具,開啟隱私保護與自動化的全新可能。 本地 AI 提供三大優勢:完全隱私(無數據上傳伺服器)、零成本運行(一次下載永久使用)、離線可用(無需網路連接)。講者強調這對處理敏感筆記和個人工作特別重要,可直接在 Obsidian 等筆記軟體中查詢個人知識庫而無隱私洩露風險。

重點整理

重點
  • 1

    本地 AI 提供三大優勢:完全隱私(無數據上傳伺服器)、零成本運行(一次下載永久使用)、離線可用(無需網路連接)。講者強調這對處理敏感筆記和個人工作特別重要,可直接在 Obsidian 等筆記軟體中查詢個人知識庫而無隱私洩露風險。

  • 2

    Ollama 是最易上手的本地模型框架,安裝只需執行單一指令或下載應用程式,新手可在一分鐘內完成整個設定流程並獲得聊天介面,使用體驗與 ChatGPT 無異。

  • 3

    模型選擇需依據硬體配置:Gemma E2B 適合 4GB RAM(手機),Gemma E4B 適合 8GB RAM(大多筆電),Gemma 31B 需 32GB+ RAM(桌機)。關鍵是「有效參數」(effective parameters) 概念能用更少資源模擬大型模型行為。

  • 4

    本地模型必須擴展上下文視窗至 64K 以支援 Hermes 等 AI 代理工具執行複雜任務,可透過建立模型變體實現,完成後即可連接外部工具進行自動化工作流程。

實用技巧與重點

乾貨
  • 安裝指令:
  • `curl -fsSL https://ollama.ai/install.sh | sh` (自動安裝)
  • `ollama version` (檢查安裝)
  • `ollama pull gemma2:7b` (拉取模型)
  • `ollama run gemma2:7b` (啟動對話)
  • `ollama list` (檢視已安裝模型)
  • `ollama ps` (查看執行狀態)
  • Gemma 2 系列規格:
  • Gemma E2B:4GB RAM,用於手機,約 2GB 儲存
  • Gemma E4B:8GB RAM,大多筆電適用,3.3GB,預設上下文 32,768
  • Gemma 12B:32GB RAM,約 12GB
  • Gemma 31B:32GB+ RAM,20GB
  • Gemma E64K(自製變體):上下文 64,000 token
  • 建立模型變體:
  • ```
  • echo "FROM gemma2:7b
  • PARAMETER num_ctx 64000" | ollama create gemma2:64k -
  • ```
  • 端點設定:
  • 本地 Ollama 端點:`http://localhost:11434`
  • OpenAI 相容端點:`http://localhost:11434/v1`
  • 支援連接工具: Hermes、Claude Code、Codex、Open Claw
  • 其他可用模型類型: Qwen 3.6(編碼)、視覺模型、嵌入模型、思考類模型

結論

結論

Ollama 讓任何人都能在三分鐘內擁有私密、零成本且完全可控的本地 AI,並透過簡單端點對接外部工具,開啟隱私保護與自動化的全新可能。

完整解析

詳細

本地 AI 運行的核心價值在於重新掌握隱私、成本與自主性。講者指出每次使用雲端 AI 都在付出代價——無論是數據被監控分析,還是直接的訂閱費用。相比之下,本地模型一次下載永久使用,所有對話永遠留在自己的電腦上,成本只有電費,且可離線運行。這對管理敏感資訊特別重要——比如在 Obsidian 等筆記軟體中直接查詢個人知識庫,整個流程完全私密。

安裝 Ollama 本身毫無難度。用戶只需執行單一指令或點擊下載,系統自動配置命令列工具。三秒內檢驗版本,數秒內拉取第一個模型(如 Gemma E4B),一分鐘後就能在終端機與 AI 對話,體驗完全等同 ChatGPT 的聊天介面。桌面應用提供更友善的 UI,支援模型切換與對話記錄保存。

然而真正的價值在於模型選擇與優化。硬體決定了可運行的模型規模:4GB RAM 的手機只適合 E2B,大多筆電的 8GB RAM 可跑 E4B,專業級桌機才能駕馭 31B 參數的模型。關鍵創新是「有效參數」概念——通過分層嵌入技術,E4B 用更少資源達到 12B 模型的效能。但這些模型的預設上下文視窗(32K token)對 Hermes 等代理工具不足,Hermes 需要 64K token 才能掛載工具。解決方案是建立模型變體,只需編寫簡單配置,無需額外存儲空間,即可將上下文翻倍。

完成優化後,用戶透過 OpenAI 相容端點將本地模型暴露給 Hermes、Claude Code 等外部工具。Hermes 中輸入自訂端點 URL 後,本地 Gemma 模型瞬間變身全功能 AI 代理,可執行多步驟任務、訪問工具、進行自動化流程——完全無需雲端依賴。講者展示進階用法:在桌機上運行大型模型,透過網路從筆電遠程呼叫。整個生態開放且可組合,用戶根據需求堆疊不同的代理框架和模型,打造完整的本地智能系統。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。