GLM-5.3在Terminal Bench 3.0取得开源第一
事件全貌
AI 综述智谱发布GLM-5.3,基于与GLM-5.2相同的743B基座模型,通过扩展后训练提升能力,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在CyberGym测试中得分84.5%,超过Mythos 5(83.8%)和GPT-5.6 Sol(83.6%)。
模型在网络安全任务中表现突出,白盒代码审查等安全任务持平Mythos 5,在269个项目中找到2,436个漏洞,部分漏洞存在长达40年。ExploitBench得分54.4%,落后于Mythos 5的78.0%,但较GLM-5.2的24.4%大幅提升;ExploitGym两小时完成105项任务,此前为29项。
因双重用途风险,智谱将先由安全伙伴受控评估,再开放API和完整权重。模型已通过Z.ai API、GLM Coding Plan和ZCode提供,权重预计在发布约两周后公开。最新报道补充,GLM-5.3在多项基准上超越Moonshot AI的Kimi K3,部分指标超过Claude Fable 5或GPT-5.6-Sol,仅约750B参数,为Kimi K3的三分之一。
AI 汇总报道生成 · 30天前更新。单篇报道保留其发布时的原貌。
GLM-5.3在多项基准上超越Kimi K3,部分指标超过Claude Fable 5或GPT-5.6-Sol。
报道时间线
沿着报道,了解事件的不同侧面。
- GLM-5.3:中国实验室如何跟上前沿步伐
Z.ai 今日发布 GLM-5.3,目前仅限编程套餐使用,API 即将上线,两周后开源权重至 Hugging Face。该模型在多项基准上超越 Moonshot AI 的 Kimi K3,部分指标超过 Claude Fable 5 或 GPT-5.6-Sol,仅约 750B 参数,为 Kimi K3 的三分之一。
- 智谱 GLM-5.3 在漏洞发现等网络防御测试中超越 Anthropic Mythos 5
智谱发布 GLM-5.3,基于 743B 基座模型后训练,在漏洞发现等网络防御测试中超越 Anthropic Mythos 5。其 Terminal Bench 3.0 从 4.6 升至 28.3,DeepSWE 达 66.9;CyberGym 得分 84.5%,但 ExploitBench 仅 54.4%,落后于 Mythos 5 的 78.0%。
- 智谱发布 GLM-5.3,称其为最强开源权重编程模型
智谱发布 GLM-5.3,与上一代 GLM-5.2 共享相同基座,全部提升来自扩展的后训练,并称其为最强开源权重编程模型,智能体任务进步最大。该模型经安全数据训练,在 269 个项目中找到 2,436 个漏洞,部分漏洞存在长达 40 年。GLM-5.3 现可通过 GLM Coding Plan 使用,权重将在安全审查完成后于两周内开源。
- Z.ai 发布 GLM-5.3:不重训基座模型,复杂编程与长程任务能力显著提升
Z.ai 发布 GLM-5.3,沿用 GLM-5.2 的 743B 基座模型,全部提升来自扩展的后训练。Terminal-Bench 3.0 得分从 4.6 升至 28.3,CyberGym 达 84.5%,超过 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。模型已通过 Z.ai API、GLM Coding Plan 和 ZCode 提供,权重预计在发布约两周后公开。
- GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力
智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一。模型在白盒代码审查等安全任务中表现持平Mythos 5,并在CyberGym测试中得分84.5%。GLM-5.3即日起上线ZCode、AutoClaw等工具,API很快上线,完整模型权重将在两周内开源。
- GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力
智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGym测试中得分84.5%。模型权重将在两周后开源,即日起上线ZCode、AutoClaw等工具。