KeyFrame內部研究專用

Claude Code + AssemblyAI: The Easiest Voice Agent You Can Build!

World of AI·6月6日週六·10 min英文

三句話摘要

用 Claude Code 搭配 Assembly AI 語音代理 API,下午內快速構建能預訂行事曆的語音助手。 使用 API 官方系統提示詞搭配 Claude Code,能將複雜的語音代理開發時間從團隊一個月縮短到個人一下午,成本透明且低廉。 API 整合化設計簡化開發複雜度——傳統做法需要串接語音轉文字、模型推理、文字轉語音三個服務且文件各異,Assembly AI 統一在一個 API 後面,減少出錯點且只付一份賬單。

重點整理

重點
  • 1

    API 整合化設計簡化開發複雜度——傳統做法需要串接語音轉文字、模型推理、文字轉語音三個服務且文件各異,Assembly AI 統一在一個 API 後面,減少出錯點且只付一份賬單。

  • 2

    系統提示詞是關鍵——Assembly AI 提供的系統提示詞包含 API 格式、瀏覽器兼容性、工具調用結構、換人檢測等細節,貼入 Claude Code 能讓它從第一次就寫對代碼,而非依賴模型猜測。

  • 3

    互動式規畫流程降低決策摩擦——Claude Code 理解系統提示詞後會逐步提問(區域、日曆系統、API 金鑰等),確認各項後才執行,使用者只需答題而非手動編碼。

  • 4

    成本透明且具競爭力——$4.50/小時包含整個堆棧,按實際通話秒數計費,無隱藏成本,相比 OpenAI $18/小時便宜,且具備斷線重連、即時提示詞更新等功能。

實用技巧與重點

乾貨
  • Assembly AI 定價:$4.50/小時(包含語音識別、模型、文字轉語音、換人檢測)
  • OpenAI 實時 API 定價:$18/小時,按音頻令牌計費(成本不可預測)
  • DeepGram 定價:$4.50/小時,但按元件逐項計費
  • 語音 ID:Ivy(預設)、James(可選更溫暖的聲音)、Winter(可選)
  • 日曆整合:Cal.com(演示中使用,包含 Google Calendar 同步)
  • API 金鑰來源:Assembly AI 官方儀表板 → API Keys、Cal.com 應用設置 → Developer → API Keys
  • 系統提示詞來源:Assembly AI 官方快速開始文件(提供完整集成提示詞)
  • 響應延遲:1 秒,與 OpenAI 相同
  • 特有功能:斷線自動重連、無需拆解會話即可更新提示詞或語音
  • 構建工具:Claude Code(AI 編碼助手)
  • 應用場景示例:諮詢業務的客戶接待助手

結論

結論

使用 API 官方系統提示詞搭配 Claude Code,能將複雜的語音代理開發時間從團隊一個月縮短到個人一下午,成本透明且低廉。

完整解析

詳細

傳統的語音代理構建涉及三個獨立服務的艱難整合:語音轉文字服務、語言模型推理,以及文字轉語音輸出。每個服務都有各自的文件、配置與計費模式,使開發人員在串接過程中容易出錯。Assembly AI 的創新在於將這三個功能統一在單一 API 連接後面——音頻進、音頻出,中間的語音識別、模型選擇、語音生成與換人檢測全部由 API 管理。這種整合大幅降低了複雜度。

Assembly AI 進一步提供了一份系統提示詞,專門為 Claude Code 等 AI 編碼助手設計。這份提示詞包含了 API 實際需要的音頻格式、瀏覽器相容性注意事項、工具調用的結構化方式,以及能產生自然對話感的換人檢測預設值。講者強調:不是直接要求 Claude Code 寫語音代理,而是先將整個系統提示詞貼入,讓 Claude Code 理解所有規則。這樣可以避免 Claude Code 仰賴模型猜測,從而確保代碼在第一次就能正確運行。

實際構建流程簡單到只需複製貼上。貼入提示詞後,Claude Code 會詢問一系列問題:你要構建什麼類型的應用、使用哪個資料區域、如何處理 API 金鑰、預訂功能如何實現(例如無日曆整合、靜態連結或真正的日曆 API)、選擇哪個日曆系統(講者選用 Cal.com)。使用者只需逐一回答,Claude Code 會根據系統提示詞的指示制訂完整計畫。確認無誤後,提供 Assembly AI 和 Cal.com 的 API 金鑰,Claude Code 即可執行構建。講者並進行了現場演示:一個名為「Nova」的語音助手接待潛在客戶,進行需求評估與合格性篩選,最後成功預訂了 30 分鐘的諮詢會議。預訂資訊實時同步到他的 Google Calendar,確認郵件亦自動寄送。

成本方面,Assembly AI 提供透明的固定時薪模型,$4.50/小時涵蓋整個堆棧,費用只在通話進行時計算,無其他隱藏成本。相比之下,OpenAI 的實時 API 需 $18/小時且按音頻令牌動態計費,使用者難以預測最終成本。DeepGram 雖然同為 $4.50/小時,但按元件逐項計費,仍需手動計算。Assembly AI 的簡潔定價模式讓使用者能輕鬆推算成本:一千通電話的費用就是一千通電話應有的費用。講者補充,Assembly AI 在相同價格下提供 1 秒響應延遲(與 OpenAI 相同)、可靠的語音識別與換人檢測,以及競爭對手沒有的斷線重連與即時會話更新等功能。他坦言 $4.50/小時非常適合突發性工作負載(如來電時才運行),但若計畫大規模持續服務,應提前進行時薪數學計算。總體而言,對於構建、測試與大多數實際工作負載,Assembly AI 的成本相當低廉。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。