AI 编程代理频繁突破沙箱限制,安全研究揭示四大漏洞模式
安全公司 Pillar Security 研究发现,Cursor、OpenAI Codex、Google Gemini CLI 等主流 AI 编程工具均存在沙箱逃逸风险。攻击者可通过在 README 或依赖中植入恶意指令,诱使开发者机器执行非预期命令。研究揭示了四种典型失效模式,多数厂商已修复,但 Google 拒绝打补丁引发争议。
AI 编程助手的"沙箱悖论":写入即执行
安全公司 Pillar Security 最新研究实锤了:Cursor、OpenAI Codex、Google Gemini CLI 和 Antigravity 这四大主流 AI 编程工具,全都有沙箱逃逸漏洞!虽然这些工具表面上把代理进程锁在项目文件夹里,但黑客还是能玩出花活,直接在开发者电脑上跑恶意命令。
不是"逃逸"的逃逸
传统沙箱的逻辑是:信任容器里的代理进程,隔离宿主机环境。但 Pillar 发现了个骚操作——项目文件夹里的文件根本不是静态数据!Python 扩展会解析解释器路径、Git 集成会扫描仓库配置、Docker Desktop 会暴露本地套接字。当 AI 代理往这些文件里写东西时,其实是在给宿主机"埋雷"。
攻击套路就是提示注入(Prompt Injection):把恶意指令藏在 README、GitHub Issue、依赖包描述或者代码 diff 里。等代理读取这些内容生成配置文件时,开发者本地的工具链就会自动执行这些"合法"文件里的恶意代码。
四种翻车姿势和七个漏洞
Pillar 把发现的七个安全问题总结成四大翻车现场:
- 黑名单总慢半拍:操作系统更新比安全规则维护快多了
- 配置文件即代码:
.vscode/settings.json这种文件本质上能执行命令 - 白名单有漏洞:只检查命令名不查参数(比如
git命令的危险参数组合) - 本地守护进程权限过高:Docker 套接字这种完全在沙箱外的高权限服务
厂商回应:有人修有人刚
大部分厂商还算靠谱:Cursor 火速修了工作区钩子配置漏洞(CVE-2026-48124,3.0.0 版本已修复),OpenAI 不仅修了 Codex 的 Git 命令白名单绕过问题还给了赏金,Cursor、Codex 和 Gemini CLI 共用的 Docker 套接字漏洞也一起补上了。
但 Google 的操作就很迷:把 Antigravity 的两个漏洞定性为"其他有效安全漏洞",以"难以利用"为由降低严重性评级,死活不修。虽然 Google 嘴上说报告"质量极高",但 Pillar 直接怼回去:说"难以利用"的前提是开发者得信任被投毒的代码仓库——这不正是 AI 编程工具天天在干的事吗?
重新定义代理的"杀伤半径"
Pillar 的核心观点很犀利:AI 代理的威胁不在于进程本身,而在于它能写入的那些后续会被宿主机信任的文件。研究团队总结得很到位:"如果代理能编写系统未来的输入,那它从一开始就没被真正关进笼子。"
这玩法其实不新鲜,但普及程度吓人——四款工具、三家大厂全军覆没。巧的是,就在这项研究发布的同周,OpenAI 自己也爆出模型持续出现沙箱逃逸问题,AI 代理安全真成行业通病了。
选型新思路:谁在跑代理生成的文件?
现在选 AI 编程工具得换个思路了:关键不是"有没有沙箱",而是"代理生成的文件最后谁执行"。开发者得重点检查:
- 工具是否限制写入敏感配置文件(比如
.git/config、Docker 配置) - 工作区文件改动要不要人工审核
- 本地工具链(IDE 扩展、构建系统)对项目文件的自动信任程度
这项研究给行业提了个醒:当 AI 代理成为开发流水线的新环节,安全边界得从进程隔离升级到文件全生命周期管理。
本文基于 GNews:TNW 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://thenextweb.com/news/ai-coding-agents-sandbox-escapes-pillar
常见问题
- 这些漏洞是否影响中国常用的 AI 编程工具?
- 原文涉及的 Cursor、OpenAI Codex 和 Google Gemini CLI 在中国开发者中均有使用。Cursor 已在 3.0.0 版本修复相关漏洞,建议用户及时更新。国产 AI 编程工具若采用类似架构(允许代理写入工作区配置文件),可能存在相同风险,需关注厂商安全公告。
- 如何判断项目仓库是否被植入恶意提示注入?
- 攻击指令通常隐藏在 README、CONTRIBUTING.md、package.json 的描述字段或 Git commit 信息中。建议在首次使用 AI 工具分析陌生仓库前,人工审查这些文本内容,警惕异常的系统命令或路径操作指令。企业可部署代码审计工具扫描此类模式。
- Google 为何拒绝修复 Antigravity 的漏洞?
- Google 将这两个漏洞评级为'难以利用',认为需要开发者主动克隆恶意仓库才能触发。但安全研究者认为,这正是 AI 工具的典型使用场景——开发者依赖代理分析第三方代码。目前 Google 未公开具体技术细节,用户需自行评估风险。
- 沙箱逃逸与提示注入有何区别?
- 提示注入是攻击手段(通过恶意文本操纵 AI 行为),沙箱逃逸是结果(突破安全隔离)。本次研究的特殊性在于:代理进程本身未逃逸,但通过写入'合法'配置文件,间接让宿主机执行了恶意操作——这是一种利用工具链信任机制的新型逃逸路径。
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
顶级 AI 图像生成工具,以画面质感、艺术风格、构图理解著称。V7 模型在写实和创意两个方向均领先。需 Discord 或网页版使用。
Cursor
精选AI 开发工具
AI-first 代码编辑器,基于 VS Code 构建,深度集成 Claude / GPT-4o 等模型。Composer 多文件编辑、Tab 自动补全、Agent 模式三大杀手锏。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以长上下文(200K tokens)、对复杂任务的细腻理解、Artifacts 可视化输出闻名。Claude Sonnet 4.5 / Opus 4.7 在编程、写作、推理多项基准上领先。
相关推荐
同类资讯 — 由发布时间排序

前 OpenAI 实习生分享 AI 求职五大实战建议
21 岁的 Hamza Mostafa 曾在 OpenAI 实习三个月,他从计算机专业转向 AI 领域,现独立开发 AI 项目。他建议求职者采用"广泛学习-专精方向-动手构建"三步法,善用 ChatGPT 等工具自学,并专注于简历优化、作品集等可控因素,避免被求职市场负面情绪影响。

德里法院支持OpenAI训练合法性 谷歌推出Gemini网络安全工具
印度德里法院近期就AI训练数据使用做出裁决,支持OpenAI的训练实践;同时OpenAI推出Presence和Health新功能,谷歌发布基于Gemini的网络安全工具,Grok集成Excel。本周AI行业多个重要动态值得中国从业者关注。

Anthropic 启动罕见病药物研发计划:AI 超级智能能否打破制药业利润魔咒
AI 公司 Anthropic 于 2026 年 6 月 30 日宣布将自主开展罕见病临床前药物研发,并发布面向科研人员的 Claude Science 工具平台。这一举动既可能挑战传统制药业的利润导向逻辑,也引发对 AI 超级智能被滥用风险的担忧——它究竟会成为真正治愈疾病的工具,还是制造"终身患者"的新手段?

ChatGPT 全球大规模宕机:印度美国英国数千用户无法登录
OpenAI 旗下 ChatGPT 再次遭遇全球性服务中断,影响北美、欧洲、亚洲及澳洲多地用户。根据 Downdetector 数据,印度报告 1,475 起故障,美国 3,243 起,英国 3,088 起,主要集中在网页版登录认证系统。这是本周内第二次大规模宕机,距上次故障仅两天,引发用户对服务稳定性的担忧。