智谱 AI 发布 GLM-5.3 模型,网络安全测试成绩超越 Anthropic Mythos 5
中国 AI 公司智谱 AI(Z.ai)推出旗舰模型 GLM-5.3,在代码安全漏洞识别基准 CyberGym 上得分 84.5%,超过 Anthropic Mythos 5 的 83.8% 和 OpenAI GPT-5.6 Sol 的 83.6%。该模型已在国内安全团队真实代码库中测试,发现 2436 个漏洞,其中 1097 个为中高危级别。智谱计划两周内公开发布,但核心安全功能仅向认证用户开放。

中国 AI 公司智谱 AI(Zhipu/Z.ai)最近放大招,推出旗舰模型 GLM-5.3,还晒出一组亮眼的网络安全测试成绩:在代码安全漏洞识别基准 CyberGym 上,GLM-5.3 得分 84.5%,直接干翻 Anthropic 的 Mythos 5(83.8%)和 OpenAI 的 GPT-5.6 Sol(83.6%)。这波操作不仅秀了中国 AI 厂商在网络安全防御技术上的肌肉,还刚好赶上中美在 AI 安全能力上掰手腕的关键时刻。
测试成绩:防守稳如狗,进攻有点菜
CyberGym 是专门测 AI 模型从源代码里抓漏洞能力的基准。GLM-5.3 在这项测试中拔得头筹,说明它在代码审计、漏洞扫描这些防守活儿上确实有两把刷子。
不过,另一项测试 ExploitBench(测 AI 模型搞破坏的能力)就有点尴尬了,GLM-5.3 只拿了 54.4%,明显掉队。这暴露出它在攻击性安全研究(比如漏洞利用、渗透测试)方面还是短板,攻防两端还不太平衡。
实战检验:揪出 2400+ 漏洞
智谱 AI 还透露,GLM-5.3 已经和国内安全团队联手,在真实代码库上打了一场硬仗。经过专家审核,这模型在 269 个项目中一口气找出 2,436 个漏洞,其中 1,097 个被定为中高危级别。这数据不仅证明了模型在实际软件系统安全审查中的实力,对开源项目维护者和中小安全团队来说,也是个不小的参考。
发布计划:搞个"可信访问"机制
智谱 AI 宣布,两周内 GLM-5.3 就会正式上线,但在这之前会先搞定安全评估,加强防护措施。重点是,这模型最敏感的网络安全功能只对认证用户开放,搞了个"可信访问"(trusted access)机制。
这套路既符合中国对生成式 AI 安全管理的监管要求,也体现了业界对"双刃剑"工具的谨慎态度——强大的漏洞识别能力要是被滥用,分分钟变成攻击利器。智谱希望通过认证机制,把高级网络防御能力优先给开源软件开发者和小型安全团队,在安全与开放之间找个平衡点。
中国视角:垂直能力突破 + 合规挑战
对中国 AI 从业者来说,GLM-5.3 的发布有两层意思:一是除了通用大模型,垂直领域能力(比如网络安全)正成为国内厂商的新战场;二是"可信访问"等机制的落地,意味着安全类 AI 工具的合规运营将成为行业标配。开发者用这类模型时,不光要关注技术能力,还得留意访问权限的申请流程。
本文基于 GNews:NewsBytes 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://www.newsbytesapp.com/news/science/zhipu-claims-its-ai-model-beats-mythos-5-in-cybersecurity/story
常见问题
- GLM-5.3 在哪些安全任务上表现更好?
- 根据测试数据,GLM-5.3 在代码漏洞识别和验证(CyberGym 基准)上表现优异,得分 84.5%,适合代码审计、安全扫描等防御性任务。但在漏洞利用能力(ExploitBench)上仅 54.4%,攻击性安全研究能力相对较弱。
- 普通开发者能直接使用 GLM-5.3 的安全功能吗?
- 智谱 AI 将采用'可信访问'机制,核心网络安全功能仅向认证用户开放。开源软件开发者和小型安全团队是优先服务对象,具体申请流程需等待正式发布后公布。
- GLM-5.3 发现的 2436 个漏洞可信度如何?
- 这些漏洞是在 269 个真实项目中由模型识别、经专家审核后确认的,其中 1097 个被评为中高危级别。专家审核环节降低了误报风险,但实际应用中仍建议结合人工复核。
- 这次测试对比的 Mythos 5 和 GPT-5.6 Sol 是什么?
- Mythos 5 是 Anthropic 的前沿模型(原文称 frontier model),GPT-5.6 Sol 疑似为 OpenAI 的某个测试版本或变体。由于原文未提供详细背景,建议以 CyberGym 官方排行榜为准核对具体模型版本。
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
顶级 AI 图像生成工具,以画面质感、艺术风格、构图理解著称。V7 模型在写实和创意两个方向均领先。需 Discord 或网页版使用。
Cursor
精选AI 开发工具
AI-first 代码编辑器,基于 VS Code 构建,深度集成 Claude / GPT-4o 等模型。Composer 多文件编辑、Tab 自动补全、Agent 模式三大杀手锏。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以长上下文(200K tokens)、对复杂任务的细腻理解、Artifacts 可视化输出闻名。Claude Sonnet 4.5 / Opus 4.7 在编程、写作、推理多项基准上领先。
相关推荐
同类资讯 — 由发布时间排序

谷歌 AI Mode 升级旅行规划功能:支持航班价格追踪与酒店预订
谷歌宣布为其对话式搜索体验 AI Mode 新增旅行规划能力,用户可通过自然语言追踪航班价格、预订酒店,并查看积分/里程兑换成本。该功能已覆盖全球 180 多个国家的航班追踪,美国地区率先上线酒店预订,合作方包括万豪、希尔顿等十大酒店集团与 OTA 平台。

Anthropic 为何既不签授权协议也未被起诉?出版商揭秘背后策略
在主流 AI 公司纷纷与出版商签署内容授权协议或对簿公堂之际,Anthropic 成为唯一例外——既未公开达成任何授权交易,也未遭到数字出版商起诉。四位媒体高管和法律专家透露,这源于其坚守"合理使用"立场、企业级产品定位,以及微妙的时机把控。但随着 Anthropic 估值冲向 9650 亿美元并加速 IPO,其数据哲学可能重塑开放网络规则。

独立音乐版权方Round Hill起诉Suno与Anthropic 索赔超10亿美元
拥有11亿美元版权资产的独立音乐发行商Round Hill于2026年8月17日分别起诉AI音乐生成平台Suno和大语言模型公司Anthropic,指控两家公司未经授权抓取其版权音乐用于模型训练。诉讼索赔金额均超10亿美元,涉及歌曲包括《Total Eclipse of the Heart》等经典作品。Round Hill CEO明确表示不会和解,其代理律师曾赢得"Blurred Lines"版权案。
客户体验进入编排时代:AI 智能体如何摆脱遗留系统束缚
企业正加速部署 AI 智能体和语音 AI,但多数只是将对话式 AI 嫁接到遗留系统上,导致编排(Orchestration)成为新挑战。塔塔通信(Tata Communications)高管指出,真正的竞争优势不在于自动化本身,而在于如何通过共享上下文层协调 AI 系统、数据和人工座席,实现无缝的端到端客户体验。