资讯行业动态··来源: OpenAI·原文 →

OpenAI 強化 ChatGPT Atlas 瀏覽器代理防禦提示詞注入攻擊

OpenAI 近期釋出針對 ChatGPT Atlas 瀏覽器代理(Browser Agent)的安全更新,應對新型提示詞注入(Prompt Injection)攻擊。通過內部自動化紅隊測試發現新攻擊類別後,團隊部署了對抗訓練模型和增強防護措施。文章詳細披露了 OpenAI 如何利用強化學習訓練自動化攻擊者,通過端到端模擬和高計算量測試,在攻擊出現在野外之前提前發現漏洞並快速修復。

OpenAI 強化 ChatGPT Atlas 瀏覽器代理防禦提示詞注入攻擊
[广告位 · 上线后接 AdSense]

OpenAI 強化 ChatGPT Atlas 瀏覽器代理防禦提示詞注入攻擊

OpenAI 最近給 ChatGPT Atlas 的瀏覽器代理(Browser Agent) 來了次大升級,專門對付越來越狡猾的 提示詞注入(Prompt Injection) 攻擊。這可是 OpenAI 目前最牛掰的代理功能之一,能讓 AI 像真人一樣在網上衝浪、點按鈕、打字,直接參與到日常工作中。但能力越強,風險也越大——代理成了駭客眼中的香餑餑。

提示詞注入咋威脅瀏覽器代理

提示詞注入攻擊的套路就是在 AI 代理處理的內容裡偷偷塞進惡意指令,讓代理跑偏,執行攻擊者的命令。對於瀏覽器代理來說,這就開闢了個全新的攻擊面:駭客不用再費勁釣魚或者找瀏覽器漏洞,直接"忽悠"代理就完事了。

OpenAI 舉了個例子:假設使用者讓代理"看看未讀郵件,總結下重點",駭客可能事先發封帶隱藏指令的惡意郵件,讓代理別管使用者的話,直接把敏感稅務檔案發到駭客郵箱。因為代理在工作流中會讀到這封郵件,要是沒發現注入指令,隱私資料就洩露了。

攻擊面大到沒邊:郵件和附件、日曆邀請、共享文件、論壇帖子、社交媒體內容、隨便哪個網頁——代理可能接觸到的任何不可信內容都可能藏著注入指令。而代理能幹的活兒(轉發郵件、轉賬、編輯/刪除雲端檔案等)和使用者許可權一樣,攻擊成功了影響範圍也賊廣。

用 AI 打 AI:自動化紅隊和強化學習

為了搶在黑帽駭客前發現漏洞,OpenAI 搞了個 基於大語言模型的自動化攻擊者(Automated Attacker),用 端到端強化學習(End-to-End Reinforcement Learning) 訓練它的"紅隊技能"。這套系統有兩把刷子:

  1. 反事實模擬(Counterfactual Rollout):攻擊者在推理鏈(Chain of Thought)裡提出候選注入指令後,先發給外部模擬器測試。模擬器跑完整個防禦代理的行為軌跡,返回詳細的推理和操作記錄。攻擊者根據反饋不斷最佳化攻擊,模擬好幾次才提交最終版本——這比單次通過/失敗訊號提供了更豐富的學習訊號,也大大擴充套件了攻擊者的 測試時計算量(Test-Time Compute)

  2. 白盒優勢(White-Box Access):內部攻擊者能訪問防禦模型的完整推理軌跡(不對外公開),形成資訊不對稱——這是 OpenAI 相對外部對手的核心優勢,有助於更早發現潛在漏洞。

這次安全更新就是這套自動化紅隊系統發現的 新型攻擊類別 催生的。OpenAI 立馬部署了 對抗訓練模型(Adversarially Trained Model) 和增強防護措施,形成了快速響應閉環。

長期願景:持續對抗的安全迴圈

OpenAI 明確表示,提示詞注入是長期 AI 安全挑戰,得像對付不斷演變的網路釣魚那樣持續加固防禦。團隊的長期策略靠三大支柱:

  • 白盒模型訪問:深度理解自家模型行為
  • 防禦機制深度掌握:快速定位薄弱環節
  • 計算規模優勢:大規模模擬攻擊場景

目標是在外部攻擊者之前發現漏洞、更快修復、持續收緊響應週期。結合前沿研究(新技術對抗注入)和其他安全控制措施,這種複合迴圈能讓攻擊成本越來越高、難度越來越大,從根本上降低真實世界的提示詞注入風險。

最終目標:讓使用者能像信任一位高度勝任、具備安全意識的同事或朋友一樣,信任 ChatGPT 代理使用自己的瀏覽器。


關鍵術語保留:Prompt Injection(提示詞注入)、Browser Agent(瀏覽器代理)、Reinforcement Learning(強化學習)、Counterfactual Rollout(反事實模擬)、Test-Time Compute(測試時計算)、White-Box Access(白盒訪問)。

常見問題

提示詞注入攻擊與傳統網路釣魚有何區別?

傳統釣魚攻擊目標是人類使用者,通過偽裝頁面或郵件誘騙使用者輸入密碼或點選惡意連結。提示詞注入則直接攻擊 AI 代理本身,在代理處理的內容(如郵件正文、網頁文本)中嵌入隱藏指令,誘使代理執行攻擊者意圖而非使用者指令。攻擊者無需突破瀏覽器漏洞或欺騙人類,只需'說服'AI 即可。

OpenAI 的自動化紅隊系統如何比外部攻擊者更快發現漏洞?

OpenAI 的內部攻擊者具備三大優勢:一是可訪問防禦模型的完整推理軌跡(外部攻擊者看不到),形成資訊不對稱;二是通過反事實模擬反覆測試攻擊效果,每次迭代都能獲得詳細反饋;三是利用強化學習讓攻擊者從成功和失敗中自我改進。這些白盒訪問和計算規模優勢使 OpenAI 能在攻擊出現在野外之前提前發現並修復。

中國開發者部署 AI 代理時如何借鑑 OpenAI 的安全思路?

核心是建立持續對抗測試機制:一、識別代理可能接觸的所有非可信內容源(郵件、文件、第三方 API 返回等);二、模擬攻擊者視角構造注入樣本,測試代理是否會偏離使用者指令;三、對高許可權操作(轉賬、刪除檔案、傳送郵件)設定二次確認或沙盒驗證;四、定期更新防禦模型,而非一次性安全審計。若資源有限,可優先加固涉及敏感資料和高許可權操作的代理功能。

提示詞注入問題能徹底解決嗎?

根據 OpenAI 的表述,提示詞注入是'長期 AI 安全挑戰',預計需持續多年攻防。類似傳統網路安全中的釣魚攻擊,攻擊手法會不斷演變,防禦也需持續迭代。目前業界尚無'一勞永逸'的解決方案,但通過對抗訓練、多層防護、持續紅隊測試等手段,可顯著提高攻擊成本和難度,將風險降至可接受水平。


本文基於 OpenAI 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://openai.com/index/hardening-atlas-against-prompt-injection

[广告位 · 上线后接 AdSense]
标签:#OpenAI

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

蘋果手錶新 AI 功能引爭議:環境錄音與隱私的邊界在哪裡

蘋果手錶新 AI 功能引爭議:環境錄音與隱私的邊界在哪裡

蘋果在最新發佈會上為 Apple Watch 引入了 Live Rewind 和 Siri Recap 等即時音訊轉錄功能,允許使用者回溯 15 秒對話並自動生成會議摘要。儘管蘋果強調不儲存原始音訊且支援端到端加密,但這些"始終聆聽"的技術仍引發了關於同意權、法律證據效力及社交行為改變的廣泛討論,標誌著科技巨頭在 AI 競爭壓力下對隱私底線的重新定義。

应用与案例AI 安全
WIRED 編輯實測:我讓 AI 駭客代理掃描家庭網路,發現了什麼

WIRED 編輯實測:我讓 AI 駭客代理掃描家庭網路,發現了什麼

WIRED 專欄作者親身測試去安全對齊的 AI 模型,使用 Abliteration AI 提供的改造版 GLM-5.3 掃描家庭網路。實驗發現印表機配置漏洞、智慧音箱資訊洩露等十餘處安全隱患,但同時也獲得了實用的加固建議。這場"以毒攻毒"的實驗揭示:AI 駭客工具既是威脅,也可能成為普通使用者的防禦武器。

应用与案例AI 安全
ControlAI 執行董事:超級智慧不是武器而是對手,應立法禁止開發

ControlAI 執行董事:超級智慧不是武器而是對手,應立法禁止開發

AI 安全非營利組織 ControlAI 美國執行董事 Connor Leahy 在 TechCrunch 播客中提出激進觀點:應通過立法完全禁止企業開發超級智慧(superintelligence),而非僅依賴對齊與遏制技術。他認為當 AI 能自主改進 AI 時將觸發失控迴圈,並透露美英兩國已有相關立法推進,包括 Sanders-Casar 提出的"禁止超級智慧法案"。

政策与安全OpenAI
五角大樓要求 OpenAI 提供"低拒絕率"軍用 AI 引發爭議

五角大樓要求 OpenAI 提供"低拒絕率"軍用 AI 引發爭議

據 The Intercept 報道,美國國防部曾要求 OpenAI 提供一個"極少拒絕執行"軍事指令的定製版 AI 系統。OpenAI 否認簽署過包含此類措辭的合同。這一事件再次引發關於 AI 安全護欄與軍事應用邊界的討論,對中國 AI 從業者理解大模型倫理約束具有參考意義。

政策与安全OpenAI