Anthropic 评估 GLM-5.3:可自主构建漏洞利用链
Anthropic 的隔离环境测试显示,GLM-5.3 在 ExploitBench 的 410 次尝试中完成了 50 次端到端漏洞利用,与 Claude Mythos Preview 的 56 次接近。其模拟恶意请求测试中,简单方法让模型在 64% 至 100% 的情况下继续响应;这些结果不能直接等同于真实攻击表现。
同一评估同时给出端到端漏洞利用成功次数和防护绕过比例,并说明后者来自模拟环境。
Anthropic 评估 GLM-5.3:可自主构建漏洞利用链
Anthropic 的隔离环境测试显示,GLM-5.3 在 ExploitBench 的 410 次尝试中完成了 50 次端到端漏洞利用,与 Claude Mythos Preview 的 56 次接近。其模拟恶意请求测试中,简单方法让模型在 64% 至 100% 的情况下继续响应;这些结果不能直接等同于真实攻击表现。
同一评估同时给出端到端漏洞利用成功次数和防护绕过比例,并说明后者来自模拟环境。
材料 cb77e73976b34ec0944b2c1f2e71f940;建议 65065ecf60e44395a1d9f036093782e5;系统证据核验通过,非人工审稿。
前往原始出处阅读