Building a Real AI Jarvis (GPT Realtime 2 + Cursor)
三句話摘要
使用 Cursor IDE 搭配 OpenAI GPT Real Time 2,無需編程經驗即可製作功能完整的個人語音 AI 桌面助手。 任何人無需編程經驗,用 Cursor 搭配 GPT Real Time 2 和精心設計的提示詞,就能在短時間內創造功能豐富、個性化的 AI 語音助手。 GPT Real Time 2 是關鍵技術 — OpenAI 最新語音模型支援實時對話、工具使用、電腦控制,能自然地中斷對話、理解上下文,是整個應用的核心魔法。
重點整理
重點- 1
GPT Real Time 2 是關鍵技術 — OpenAI 最新語音模型支援實時對話、工具使用、電腦控制,能自然地中斷對話、理解上下文,是整個應用的核心魔法。
- 2
Cursor Agent 自動化構建流程 — 將需求寫成詳細提示詞(UI 設計、功能特性、動畫效果),Cursor 用 GPT-4o 自動生成完整應用,無需開發者手動編寫程式碼。
- 3
API 整合是關鍵配置步驟 — OpenAI API 驅動語音功能,Exa API 提供高品質網路搜尋,兩者密鑰配置正確後立即啟用相應功能,配置錯誤會導致功能失效。
- 4
快速迭代循環優化細節 — 初版應用完成後,可列舉所有改進需求一次性提交給 Cursor,它會自動修復圖表解析錯誤、重新設計 UI 版面、優化動畫效果、新增高階工具(如並行生成圖像網格)。
實用技巧與重點
乾貨- 工具與平台
- Cursor 下載:cursor.com
- OpenAI API 密鑰:openai.com/api-keys
- 網路搜尋 API:Exa
- 應用框架:Electron(桌面應用)
- 圖表工具:Mermaid
- 使用模型:GPT-4o(程式碼生成)、GPT Real Time 2(語音對話)、GPT Image(圖像生成)
- 功能清單
- 實時語音對話(中斷、理解上下文)
- 網路搜尋(Exa API)
- 圖像生成與編輯
- Mermaid 圖表繪製
- 本地筆記保存
- 電腦控制模式(點擊、輸入、應用操作)
- 菜單顯示(列舉所有功能)
- 圖像生成工作流
- 3 列網格排列格式
- 最新生成圖像出現在位置 1
- 每張圖編號可引用(如「編輯第 13 張」)
- 支援描述編輯(「加上藍色墨鏡」自動編輯現有圖像)
- 並行生成多個版本
- 構建時間
- 初版應用:10-15 分鐘
- 迭代改進:5-10 分鐘(每輪修改)
結論
結論“任何人無需編程經驗,用 Cursor 搭配 GPT Real Time 2 和精心設計的提示詞,就能在短時間內創造功能豐富、個性化的 AI 語音助手。”
完整解析
詳細這段影片展示了在零編程基礎下,使用 Cursor IDE 和 OpenAI 最新技術打造個人化 AI 助手的完整過程。講者分三階段完成:初期構建核心應用、配置 API 修復功能缺陷、迭代優化用戶體驗和高階功能。
初期構建與技術基礎 流程從在 Cursor 中建立新專案開始。核心思想是寫一份詳細的自然語言提示詞,描述應用的所有需求——包括 UI 設計(簡潔風格、臉部動畫、左右分割版面)、功能需求(網路搜尋、圖表生成、圖像編輯)、交互方式(語音控制、電腦操控)。講者強調,GPT Real Time 2 是這個應用的「魔法」核心——它是 OpenAI 的嶄新語音模型,能夠進行自然實時對話、支援工具調用、理解使用者中斷,使互動體驗彷彿在與真人交談。Cursor 根據提示詞自動部署 GPT-4o 進行程式碼生成,在 10-15 分鐘內完成整個 Electron 桌面應用,包括帶眨眼和表情動畫的 AI 角色、對話介面和多功能面板。
API 整合與功能啟用 應用完成後,講者發現網路搜尋功能無法運作,原因是缺少 Exa API 密鑰。Exa 是一個高品質的網路搜尋 API,能讓 AI 助手快速存取最新網路資訊。透過從 Exa 平台獲取 API 密鑰並提交給 Cursor(在提示詞中貼上密鑰),應用自動重新生成並包含了正常運作的網路搜尋功能。同時 OpenAI API 密鑰配置用於驅動 GPT Real Time 語音功能。這個過程展示了 Cursor 的優勢——不需要開發者手動除錯或修改程式碼,只需提供新資訊並重新執行提示詞,系統自動更新整個應用。
迭代優化與高階功能 初版應用後,講者列舉十多項改進需求:修復 Mermaid 圖表的解析錯誤、移除過多圓角改採極簡設計、優化按鈕排版到左側面板底部、調整左右版面比例至 50:50、改進口型同步動畫質量使其更逼真。Cursor 根據這份綜合需求清單逐一實現改進。特別亮眼的是圖像生成與編輯工具的設計——用戶要求 AI 能夠生成多個縮圖候選,以 3 列網格形式顯示,每新生成的圖像自動插入位置 1(最新),所有圖像自動編號。使用者可以通過語音說出編號選擇特定圖像(「顯示第 13 張」),也可以提出編輯要求(「加上藍色墨鏡」、「背景改成森林」),應用會更新該位置的圖像。電腦控制模式允許 AI 助手在取得使用者確認後操作桌面——打開應用、輸入文字、按下按鍵等,增加了實用性。
實踐應用與商業擴展 整個過程展示了成品 AI 助手的實際能力:進行網路搜尋並以簡潔方式總結(如「最新世界盃新聞」轉化為易理解的文字說明)、生成並編輯圖像進行縮圖製作工作流、用 Mermaid 圖表可視化複雜概念(如「AI 工作原理」流程圖)、進入電腦控制模式執行桌面操作。講者提及其團隊正在協助企業在 Slack、iMessage 等團隊溝通工具中集成 AI 代理,用於營銷廣告管理、內容創建、市場研究等實際工作流程。完整應用程式碼將上傳至 GitHub,使用者可直接克隆或基於提示詞範本創作自己的版本。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


