This Is How Experienced Developers Use AI (Live Build)
三句話摘要
展示有經驗開發者使用 AI 模型和開發工具從零開始構建應用的完整工作流程與除錯策略。 用 AI 高效構建應用的關鍵不在於完美的初始提示,而在於:扎實的前期規劃、集成工具的正確設置(MCP 伺服器、代理技能),以及在迭代中提供清晰上下文和主動除錯。 前期準備決定成敗 — 影片開頭強調務必花時間研究現有方案、評估技術棧,確定使用哪些 API 和工具。講者選擇了 Whisper(xAI)做語音轉文字、Claude 分析內容選擇片段、ImageKit 處理影片轉碼和人臉追蹤,正是因為提前驗證了這些工具的具體功能。
重點整理
重點- 1
前期準備決定成敗 — 影片開頭強調務必花時間研究現有方案、評估技術棧,確定使用哪些 API 和工具。講者選擇了 Whisper(xAI)做語音轉文字、Claude 分析內容選擇片段、ImageKit 處理影片轉碼和人臉追蹤,正是因為提前驗證了這些工具的具體功能。
- 2
有效集成工具減少工程成本 — 透過 Cursor 安裝 ImageKit 的代理技能(agent skills)和 MCP 伺服器,AI 可直接調用工具文件和 API,而非人工複製貼上文檔。GitHub MCP 伺服器自動建立版本控制,設置專案規則讓 AI 在主要變更後自動提交,這些前置設置讓後續開發效率倍增。
- 3
用語音輸入和多代理加速迭代 — 講者使用 Whisper Flow 語音轉文字向 AI 快速表述需求,並在 Cursor 中啟用多代理功能讓多個 AI 並行工作。從架構設計到程式碼實現,大約只需 10 個提示詞就完成應用,關鍵在於先做好結構化的規劃提示。
- 4
主動除錯而非被動等待 — 當 AI 犯錯(如試圖上傳完整影片給 Whisper 而非先轉音頻),講者會立即指出问题、補充上下文、甚至截圖標註,而非盲目重跑。這種主動式的回饋迴圈大幅縮短除錯時間。
實用技巧與重點
乾貨- 核心工具與選擇
- 開發環境:Cursor(比 Claude Code 執行效率更高)
- 語音轉文字:Whisper Large v3 Turbo(來自 xAI)
- AI 決策模型:Claude Opus 4.8(frontier model 適合從零構建,GPT-5.5 用於大幅重構,Composer 2.5 用於 UI 快速迭代)
- 影片與圖片處理:ImageKit(支援人臉追蹤、解析度轉換、適應性碼率串流、URL 轉換查詢參數自動應用效果)
- 版本控制與自動化:GitHub MCP 伺服器
- 語音輸入:Whisper Flow(免費使用,可原生整合 Cursor)
- ImageKit 免費版限制
- 最大上傳 100MB(pro 版為 2GB)
- 支援自動影像和影片優化、人臉對齐、影片人臉追蹤和重構
- 工作流程步驟
- 研究現有方案與確認技術棧
- 在 Cursor 中用語音輸入描述需求,讓 AI 生成架構與路線圖
- 安裝相關工具的 MCP 伺服器和代理技能
- 驗證 API 密鑰並配置環境變數(.env.local)
- 設置專案規則檔案(rules/),要求每次主要變更後自動提交
- 啟用多代理模式,讓 AI 並行處理不同模組
- 迴圈迭代:發現 bug→提供完整上下文→AI 修復→測試
- 使用 ImageKit URL 轉換的方式
- 直接在影片 URL 後添加查詢參數,自動應用轉碼效果
- 無需事先下載或處理,ImageKit 伺服器端快速轉換
結論
結論“用 AI 高效構建應用的關鍵不在於完美的初始提示,而在於:扎實的前期規劃、集成工具的正確設置(MCP 伺服器、代理技能),以及在迭代中提供清晰上下文和主動除錯。”
完整解析
詳細這支影片詳實記錄了一位經驗豐富的開發者如何系統地用 AI 工具構建一款 AI 短影片生成應用(類似 Opus Clip)的完整過程。講者強調,成功的 AI 輔助開發並不在於堆砌提示詞,而在於前期架構。
首先是深度規劃階段。講者沒有倉促跳入編碼,而是花時間研究市場上已有的工具(例如 Opus Clip 本身),並決定使用哪些 API 與技術棧。他識別出應用的核心困難:選擇好的短影片片段相對容易(只需分析文字逐字稿),但將片段轉換成實際影片、添加字幕、調整人臉位置、轉換為直式格式才是重點。於是他選定了 Whisper 做語音辨識、Claude 做內容分析和標題生成、ImageKit 做影片處理,並決定用 Next.js 作為前端框架。
接著是工作環境設置。講者在 Cursor(一個基於 Claude 但具有更強編碼工程的 IDE)中進行開發,配置了 Cursor 的代理技能和 MCP 伺服器。特別是安裝 ImageKit 的代理技能後,AI 可以直接理解 ImageKit 的所有 API 端點和轉換能力,而無需講者手動複製貼上文件。同時安裝 GitHub MCP 伺服器讓 AI 自動建立版本庫與提交變更。這些前置工作看似繁瑣,但大幅降低了後續開發的認知負擔。
講者使用 Whisper Flow(一套免費的語音轉文字工具)向 AI 快速口述需求,AI 生成了初步的架構文檔和技術規劃。隨後啟用 Cursor 的多代理模式,讓多個 AI 並行處理不同功能模組。這裡的關鍵是講者已經在初始提示中清楚地描述了應用目標和各工具的預期角色,所以 AI 有明確的方向。
在實際開發過程中出現了多個 bug。當上傳功能成功但轉錄失敗時,講者沒有陷入困頓,而是「主動除錯」:他提供完整上下文(「上傳成功了,但轉錄卡住」),並指出了真正的問題——AI 試圖上傳完整影片給 Whisper 而非先提取音頻。講者知道 ImageKit 可以透過 URL 查詢參數自動提取音頻,所以能準確指導 AI 的修正方向。當最終影片出現時,字幕位置不佳,講者也只需一個簡短的提示就能讓 AI 調整。
整個過程中,講者約使用了 10 個核心提示詞(不計被剪掉的片段)就完成了一個可運作的應用。這並非因為 AI 完全無誤,而是因為講者充分準備了工具環境,並採用了高效的回饋迴圈。每當遇到問題,他會截圖、補充上下文、指出具體位置,而不是籠統地說「這裡有問題」。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


