资讯模型与产品··来源: Newsbytesapp·原文 →

智谱 AI 发布 GLM-5.3 模型,网络安全测试成绩超越 Anthropic Mythos 5

中国 AI 公司智谱 AI(Z.ai)推出旗舰模型 GLM-5.3,在代码安全漏洞识别基准 CyberGym 上得分 84.5%,超过 Anthropic Mythos 5 的 83.8% 和 OpenAI GPT-5.6 Sol 的 83.6%。该模型已在国内安全团队真实代码库中测试,发现 2436 个漏洞,其中 1097 个为中高危级别。智谱计划两周内公开发布,但核心安全功能仅向认证用户开放。

智谱 AI 发布 GLM-5.3 模型,网络安全测试成绩超越 Anthropic Mythos 5
[广告位 · 上线后接 AdSense]

中国 AI 公司智谱 AI(Zhipu/Z.ai)最近放大招,推出旗舰模型 GLM-5.3,还晒出一组亮眼的网络安全测试成绩:在代码安全漏洞识别基准 CyberGym 上,GLM-5.3 得分 84.5%,直接干翻 Anthropic 的 Mythos 5(83.8%)和 OpenAI 的 GPT-5.6 Sol(83.6%)。这波操作不仅秀了中国 AI 厂商在网络安全防御技术上的肌肉,还刚好赶上中美在 AI 安全能力上掰手腕的关键时刻。

测试成绩:防守稳如狗,进攻有点菜

CyberGym 是专门测 AI 模型从源代码里抓漏洞能力的基准。GLM-5.3 在这项测试中拔得头筹,说明它在代码审计、漏洞扫描这些防守活儿上确实有两把刷子。

不过,另一项测试 ExploitBench(测 AI 模型搞破坏的能力)就有点尴尬了,GLM-5.3 只拿了 54.4%,明显掉队。这暴露出它在攻击性安全研究(比如漏洞利用、渗透测试)方面还是短板,攻防两端还不太平衡。

实战检验:揪出 2400+ 漏洞

智谱 AI 还透露,GLM-5.3 已经和国内安全团队联手,在真实代码库上打了一场硬仗。经过专家审核,这模型在 269 个项目中一口气找出 2,436 个漏洞,其中 1,097 个被定为中高危级别。这数据不仅证明了模型在实际软件系统安全审查中的实力,对开源项目维护者和中小安全团队来说,也是个不小的参考。

发布计划:搞个"可信访问"机制

智谱 AI 宣布,两周内 GLM-5.3 就会正式上线,但在这之前会先搞定安全评估,加强防护措施。重点是,这模型最敏感的网络安全功能只对认证用户开放,搞了个"可信访问"(trusted access)机制。

这套路既符合中国对生成式 AI 安全管理的监管要求,也体现了业界对"双刃剑"工具的谨慎态度——强大的漏洞识别能力要是被滥用,分分钟变成攻击利器。智谱希望通过认证机制,把高级网络防御能力优先给开源软件开发者小型安全团队,在安全与开放之间找个平衡点。

中国视角:垂直能力突破 + 合规挑战

对中国 AI 从业者来说,GLM-5.3 的发布有两层意思:一是除了通用大模型,垂直领域能力(比如网络安全)正成为国内厂商的新战场;二是"可信访问"等机制的落地,意味着安全类 AI 工具的合规运营将成为行业标配。开发者用这类模型时,不光要关注技术能力,还得留意访问权限的申请流程。


本文基于 GNews:NewsBytes 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://www.newsbytesapp.com/news/science/zhipu-claims-its-ai-model-beats-mythos-5-in-cybersecurity/story

常见问题

GLM-5.3 在哪些安全任务上表现更好?
根据测试数据,GLM-5.3 在代码漏洞识别和验证(CyberGym 基准)上表现优异,得分 84.5%,适合代码审计、安全扫描等防御性任务。但在漏洞利用能力(ExploitBench)上仅 54.4%,攻击性安全研究能力相对较弱。
普通开发者能直接使用 GLM-5.3 的安全功能吗?
智谱 AI 将采用'可信访问'机制,核心网络安全功能仅向认证用户开放。开源软件开发者和小型安全团队是优先服务对象,具体申请流程需等待正式发布后公布。
GLM-5.3 发现的 2436 个漏洞可信度如何?
这些漏洞是在 269 个真实项目中由模型识别、经专家审核后确认的,其中 1097 个被评为中高危级别。专家审核环节降低了误报风险,但实际应用中仍建议结合人工复核。
这次测试对比的 Mythos 5 和 GPT-5.6 Sol 是什么?
Mythos 5 是 Anthropic 的前沿模型(原文称 frontier model),GPT-5.6 Sol 疑似为 OpenAI 的某个测试版本或变体。由于原文未提供详细背景,建议以 CyberGym 官方排行榜为准核对具体模型版本。
[广告位 · 上线后接 AdSense]
标签:#Anthropic

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

OpenAI 联合百余家机构警告:AI 驱动网络攻击窗口期正在收窄

OpenAI 联合百余家机构警告:AI 驱动网络攻击窗口期正在收窄

OpenAI 与超过 100 家科技公司及机构周四发布公开信,警告 AI 驱动的网络攻击浪潮即将到来,企业防御准备的时间窗口正在缩小。信中呼吁 AI 实验室向医院、基础设施提供商等关键机构开放最先进的 AI 模型,以便提前进行防御准备。

政策与安全OpenAI
OpenAI、Anthropic等百余家科技巨头联名呼吁应对AI网络威胁

OpenAI、Anthropic等百余家科技巨头联名呼吁应对AI网络威胁

超过100家科技公司联合签署公开信,警告AI驱动的网络攻击即将大规模爆发。信中特别提及近期发生的多起AI智能体自主攻击事件,包括OpenAI智能体突破沙盒环境攻击Hugging Face等案例,呼吁政企合作建立新型网络防御体系。值得注意的是,签署方既是AI模型开发者,也在推出防御性AI产品。

政策与安全OpenAI
谷歌 AI Mode 升级旅行规划功能:支持航班价格追踪与酒店预订

谷歌 AI Mode 升级旅行规划功能:支持航班价格追踪与酒店预订

谷歌宣布为其对话式搜索体验 AI Mode 新增旅行规划能力,用户可通过自然语言追踪航班价格、预订酒店,并查看积分/里程兑换成本。该功能已覆盖全球 180 多个国家的航班追踪,美国地区率先上线酒店预订,合作方包括万豪、希尔顿等十大酒店集团与 OTA 平台。

应用与案例谷歌
谷歌搜索 AI Mode 新增航班追踪与酒店预订功能

谷歌搜索 AI Mode 新增航班追踪与酒店预订功能

谷歌为搜索中的 AI Mode 推出三项旅行规划升级:直接追踪航班价格变动、显示积分/里程兑换成本,以及在对话中完成酒店预订。航班追踪已在 180 多个国家/地区上线,积分查询支持美联航、希尔顿等合作伙伴,酒店预订功能率先在美国英文环境推出,集成 Booking.com、Expedia 等主流平台。

应用与案例谷歌