Anti gravity EP08:Agent代理 複製你的聲音_別再付費買 AI 語音了!一行指令免費複製你的聲音
三句話摘要
介紹開源免費的 VoxCPM2 語音克隆工具,支持聲音複製和任意語音生成,可直接在本地運行無需付費。 VoxCPM2 開源模型讓高品質語音克隆與任意語音生成完全免費本地化,搭配 Agent 自然語言控制與 Subagent 並行處理,大幅降低內容創作門檻,但需注意道德使用避免未經同意克隆他人聲音。 成本革命:過去使用 OpenAI TTS 需付費且依賴 API,VoxCPM2 完全免費開源,在本地硬體運行,不產生 Token 消耗,只有 Agent 協作分析才計費,經測試成本極低。
重點整理
重點- 1
成本革命:過去使用 OpenAI TTS 需付費且依賴 API,VoxCPM2 完全免費開源,在本地硬體運行,不產生 Token 消耗,只有 Agent 協作分析才計費,經測試成本極低。
- 2
雙核心功能:支持聲音克隆(錄製 15-30 秒樣本學習說話者特徵)與任意聲音生成(根據文字描述創造全新聲音),應用於影片配音、教學旁白、多人對話、虛擬角色等場景。
- 3
硬體親民:雖然 NVIDIA 顯卡最優,但文書筆電用 CPU 也能運行(速度較慢但可接受),講者親測確認可行,強調時間換空間的實用性。
- 4
Agent 整合:用自然語言直接控制而非傳統 UI,支持打包為全域技能在任何專案調用,可用 Subagent 並行合成多個角色語音,大幅提升工作流效率。
實用技巧與重點
乾貨- 模型資訊
- 名稱:VoxCPM2
- 特性:開源、免費、可商用、本地運行
- 支援語言:繁體中文、簡體中文、閩南語、台語(需台羅文字)、英文等
- 硬體要求
- 最優:Windows + NVIDIA 顯卡(如 RTX 4080)
- 次佳:Intel Arc 顯卡
- 可行:Mac 或 CPU 模式(速度慢但可用)
- 核心功能
- 聲音克隆:錄製 15-30 秒語音樣本 + 對應逐字稿
- 任意聲音創造:提供名稱 + 聲音特徵描述
- 多人對話合成:同時生成多個角色並組合成對話
- 應用案例
- 影片配音、教學旁白、產品介紹
- 本土語課程製作
- 虛擬助教聲音設計
- 自動化解題影片製作
- 支援 Agent
- AntiGravity(已測試確認)
- Claude Code(理論可行)
- OpenCode(理論可行)
- Codex(理論可行但未充分測試)
- 設置步驟
- 檢查 Agent 額度(需付費 Agent 且額度充足,例如 5 小時 100%)
- 新建專案資料夾(建議本地硬碟不要雲端硬碟,因檔案較大)
- 將 GitHub repo 網址貼給 Agent,自動安裝依賴
- 啟動網頁錄音介面(或用 Python 終端機手動執行)
- 錄製聲音樣本(允許麥克風存取)
- 儲存聲音,用自然語言指令生成語音
- 打包成全域技能供後續專案使用
- 技能打包方式
- 建立全域技能(Global Skill)
- 命名為「三師爸語音」等識別名稱
- 任何專案中說「用三師爸的聲音做 X」即自動調用
- 並行處理
- 用 Subagent 同時執行多個語音生成任務
- 三個 Subagent = 三倍 Token 消耗(需斟酌)
- Token 成本
- 主要消耗在 Agent 分析與協調
- 語音合成用本地硬體,不產生額外 Token
結論
結論“VoxCPM2 開源模型讓高品質語音克隆與任意語音生成完全免費本地化,搭配 Agent 自然語言控制與 Subagent 並行處理,大幅降低內容創作門檻,但需注意道德使用避免未經同意克隆他人聲音。”
完整解析
詳細以往高品質語音合成技術被商業化壟斷。OpenAI、Google 等大廠提供的 TTS 服務效果優秀但需付費,且必須透過 API 調用進行管理。免費工具如 Google Text-to-Speech 則音質單調、表現力弱,難以應用於專業內容製作。這形成了一個矛盾:要麼花錢用好工具,要麼免費用差工具。直到最近開源社群發佈的 VoxCPM2 打破了這個局面。
VoxCPM2 的核心競爭力在於完全開源免費,且支持終極克隆技術。使用者只需錄製 15-30 秒包含特定文字的音頻樣本,模型即可學習說話者的音調、節奏、口氣與個人特徵。隨後可以用該聲音合成任意長度的文本。更進階的功能是任意聲音生成——根據文字描述創造從未存在過的聲音。講者在直播中示範創造了名叫「小克」的虛擬黑貓角色,僅用「細膩溫柔帶喵喵叫」的描述,AI 就生成出一個獨特的聲音特徵。
硬體需求相對親民。理想配置是 Windows 配 NVIDIA 顯卡(如 RTX 4080),能大幅加速模型推理。但即使使用文書筆電的 CPU 模式,速度雖然下降但仍可接受。講者親自測試過確認可行。整個安裝流程透過 Agent 自動化完成——用戶只需將 GitHub 倉庫網址提交,Agent 會自動下載模型、安裝 PyTorch 依賴及 CUDA 支持、配置環境,過程完全免除手動干預。
集成方式打破了傳統工具的束縛。不同於市面 TTS 工具依賴 UI 按鈕操作,VoxCPM2 可直接透過 Agent 的自然語言控制。講者在 Agent IDE 的專案中用文字指令讓模型唱歌、用台語與閩南語發聲、生成多人對話場景。生成的語音自動保存在專案內,隨後可打包成全域技能供跨專案調用。只要說「用三師爸的聲音幫我配音」,系統即自動調用該技能進行 TTS。此外支持 Subagent 並行處理,可同時生成多個角色語音再組合成對話,大幅提升工作流效率。
Token 成本遠低於 API 調用方案。語音合成完全運行在本地硬體上,不消耗 Token,只有 Agent 協作分析環節才計費。講者檢查額度後發現多次演示測試消耗很少,充分體現了本地推理的經濟優勢。
應用場景極為廣泛。教師可用自己的聲音製作課前預習、課後參考影片,學生聽到熟悉的聲音會更專注。內容創作者可自動生成產品介紹、影片配音而無需支付訂閱費。本土語教學可突破發音資源限制,生成自然的台語或閩南語內容。進階應用是用多個虛擬角色進行對話式教學。講者現場示範了用數學教學 PPT 自動生成講解影片——把簡報交給 Agent,它讀懂內容、自動生成講解旁白,再用克隆的「三師爸」聲音配音,整個流程自動化完成,完全不需人工干預。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


