KeyFrame內部研究專用

How to Build an AI Agent in UiPath (Step-by-Step Tutorial)

Kevin Stratvert·7月2日週四·11 min英文

三句話摘要

在 UiPath 中從零開始建構 AI agent:從命令列開發到視覺化測試的完整流程。 UiPath 的 agent 開發框架透過結構化 JSON 配置、命令列驗證與互動式測試,使開發者能快速建構、測試和優化決策型 AI agent,最後無縫整合至生產工作流。 多元開發方式:UiPath 支援純命令列開發、視覺化編輯器,或兩者混合,開發者依偏好選擇。從程式碼上傳至 Studio Web 後仍可視覺化編輯和測試,兼顧靈活性與易用性。

重點整理

重點
  • 1

    多元開發方式:UiPath 支援純命令列開發、視覺化編輯器,或兩者混合,開發者依偏好選擇。從程式碼上傳至 Studio Web 後仍可視覺化編輯和測試,兼顧靈活性與易用性。

  • 2

    雙檔案結構控制:agent.json 定義 agent 核心(模型設定、系統提示、輸入輸出架構),entrypoints.json 將相同架構公開給解決方案執行時。兩檔案架構必須完全一致,否則驗證失敗。

  • 3

    互動式測試與反覆優化:上傳至 Studio Web 後可在 Debug 環境用 JSON 輸入測試,觀察 agent 推薦結果是否符合預期。根據不同測試案例調整系統提示詞,逐步提升 agent 可靠性。

  • 4

    生產工作流整合:開發完成後透過 UiPath Maestro 編排 agent 為端到端工作流的一部分,實現人員、系統、AI 三方協調與資料流轉。

實用技巧與重點

乾貨
  • 環境與工具:
  • Node.js 版本:18 或更新
  • UiPath CLI 版本:1.1.1.1
  • IDE:VS Code(免費,推薦)
  • 認證:瀏覽器登入 UiPath 帳戶
  • 核心命令:
  • `npm install -g @uipath/agent` — 安裝 agent 工具
  • `uipath-agent create <solution-name>` — 建立解決方案
  • `uipath-agent create <solution-folder>/<project-name>` — 建立專案
  • `uipath-agent validate` — 驗證 agent 定義
  • `uipath-agent upload` — 上傳至 Studio Web
  • 配置檔案核心欄位:
  • agent.json:input schema、output schema、system prompt、model settings
  • entrypoints.json:與 agent.json 結構保持一致的輸入輸出定義
  • 測試方法:
  • Studio Web Debug 功能支援 JSON 格式輸入
  • 範例:`{"request": "我想要巧克力但不會太甜", "options": ["chocolate chip", "double chocolate", "oatmeal raisin", "sugar cookie"]}`
  • 進階工具:
  • 可選:安裝編碼工具技能(Claude、Cursor、Copilot、Gemini)增強 AI 輔助
  • UiPath Maestro — 用於工作流編排與整合

結論

結論

UiPath 的 agent 開發框架透過結構化 JSON 配置、命令列驗證與互動式測試,使開發者能快速建構、測試和優化決策型 AI agent,最後無縫整合至生產工作流。

完整解析

詳細

UiPath 提供了融合程式碼優先與低程式碼視覺化的完整 AI agent 開發體驗。影片以建構 cookie 推薦 agent 為例,系統示範整個開發流程。

第一階段:環境準備與認證。 開發者需確保機器上安裝 Node.js 18 或更新版本,再透過 npm 安裝 UiPath CLI 和 agent 工具,驗證版本號確認安裝成功。隨後在 VS Code(或任何終端)中登入 UiPath 帳戶,取得必要的認證權限。對於使用 Claude、Cursor 或其他編碼輔助工具的開發者,可選擇安裝對應的 UiPath 技能擴充套件,增強工具對 agent 專案的上下文理解,但這不是強制要求。

第二階段:專案初始化與配置。 建立工作資料夾後,透過命令列建立解決方案(solution)和專案(project)。UiPath 中的 agent 由兩個關鍵 JSON 檔案定義。agent.json 控制 agent 的核心行為,包括輸入架構(定義 agent 接收的資料,如使用者的 cookie 偏好描述和選項列表)、輸出架構(定義 agent 返回的推薦結果)以及系統提示詞(告訴 agent 如何評估並選出最符合要求的選項)。entrypoints.json 將相同的輸入輸出架構公開給解決方案的執行時環境。兩檔案的架構必須完全一致,否則驗證會失敗。

第三階段:驗證與上傳。 開發者在命令列運行驗證命令,確保 agent 定義、輸入輸出和 entrypoints 都符合規範。驗證成功後上傳至 UiPath Studio Web,系統返回成功訊息和設計師 URL,開發者可直接開啟連結進入視覺化編輯環境。

第四階段:互動式測試與優化。 在 Studio Web 的 agent builder 中,開發者可看到系統提示詞和輸入輸出欄位的視覺化表現。透過 Debug 功能輸入 JSON 格式的測試資料(例如「我想要巧克力但不會太甜」,並列出各種 cookie 選項),觀察 agent 的推薦結果(例如 chocolate chip)。如果輸出不符預期,開發者可調整系統提示詞使其更精確,再次運行測試。影片示例中第二次測試改為「我想要經典款,有葡萄乾和燕麥」,agent 正確推薦了 oatmeal raisin,驗證了調整的有效性。

第五階段:評估與迭代。 UiPath 提供評估工具讓開發者運行多個測試案例並追蹤 agent 的效能指標。隨著時間推移,開發者可不斷改進提示詞,提升 agent 在實際工作流中的可靠性和準確性。

生產部署。 開發完成後,開發者可使用 UiPath Maestro 將 agent 編排為更大端到端工作流的一部分,實現人員、系統和 AI 之間的協調與資料流轉。影片強調,無論開發者偏好程式碼編寫、視覺化設計還是兩者混合,UiPath 都提供充分的靈活性與工具支援。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。