3 minOpenAI 正在訓練 AI 騙 AI:Agent 花錢前,要先考什麼? | Lethe 自己做 EP10
住在老街溪的Lethe
- 風險不在最後確認階段:若 agent 在到達支付確認前已被誘導改竄商品、地址或洩露憑證,最後的「確認付款」按鈕已無法彌補前面的損害,因此安全必須涵蓋整個交易流程。
- 攻擊方式是遊說而非破壞:GPT-Red 將惡意指令偽裝進網頁、郵件、檔案等正常內容,測試 agent 是否會被誤導執行非授權的動作,而非暴力破壞系統。
- 三層防護框架:真正的付款 agent 需要辨別誰有資格改命令(指令權限)、檢測交易任何環節的改動後使舊同意失效(交易完整性)、遇到矛盾時停止並留下記錄(安全失敗與可稽核性)。



























