①与GLM-5.2相比,基座模型没变,但通过训练Scaling实现编程能力50%提升; ②网络安全是AI能力落地最刚性的场景之一,智谱在这个节点选择重投,看到的是供给严重不足和合规压力持续加大的双重需求。
《科创板日报》8月15日讯(记者 李明明)国产开源大模型的牌桌上,又落下一张新牌。
8月14日,智谱亮出自己的最新答卷——新一代基座模型GLM-5.3正式发布。
《科创板日报》记者获悉,该模型总参数规模7430亿,主要通过后训练实现能力跃升,在代码与网络安全两个方向上的表现"超出立项时预期":代码能力居开源模型第一,对齐最强闭源模型Claude Fable 5;在白盒代码审查与漏洞推理等基础安全任务中超过Mythos 5。
值得一提的是,近期全球大模型新品密集迭代、上新节奏明显提速。北京时间8月13日凌晨,DeepSeek正式发布V4 Pro(DeepSeek-V4-Pro-0813)并上线API,新版本重点强化Agent智能体能力。
稍早前,马斯克旗下xAI刚刚发布Grok 4.6,叠加此前亮相的Kimi K3、阿里通义千问新一代旗舰版本,国内外厂商集中加码复杂任务、工具调用方向,大模型赛道竞争进一步升温。
实测GLM-5.3
智谱相关人士对《科创板日报》记者称,与GLM-5.2相比,基座模型没变,但通过后训练Scaling实现编程能力50%提升,出现了超出预期的模型能力。
相关数据显示,在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3(Kimi K3为17.4);在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9(K3为67.5);在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents' Last Exam上,得分从23.8提升至28.5(K3为27.6);在覆盖44种职业、考察真实高价值知识工作的GDPval-AA v2中得分1769(K3为1682),展现出基于编程的专业任务执行能力。
GLM-5.3没有改动基座模型,完全依靠放大后训练规模就实现编程能力50%提升,在多个开源编程基准冲到第一。后训练Scaling是否已经成为大模型迭代的新主流路线?
赛迪顾问人工智能与大数据研究中心分析师白润轩对《科创板日报》记者分析,后训练Scaling正在成为大模型迭代的关键路线,这个判断在GLM-5.3上得到了比较清晰的验证。基座模型继续堆算力的边际收益在收窄,行业内已经开始把更多资源投入到强化学习、长程任务环境和可验证奖励机制上,而不是一味追求参数规模扩张。GLM-5.3基座没变,靠扩大后训练规模把编程能力往上拉了一个台阶,说明基座之上还有可观的智能空间可以被激活,这条路在工程上是成立的。
谈及这种能力暴涨是否为基准测试的”刷分效应”,他判断,这种路线和单纯刷榜有本质区别。刷榜依赖的是静态数据集和固定评测指标,模型可以从人类偏好里学习对齐技巧来提高分数。而GLM-5.3的后训练依赖的是真实可执行的代码环境,模型必须在终端里跑测试、看报错、反复修改,训练信号来自任务是否真正完成。所以它的能力根基更接近真实软件工程场景,而不是对评测题目的模式匹配。GLM-5.3把后训练从调对话风格推进到了解决长链路工程问题这个层面,方向本身是真实的,但具体迁移效果还要看后续在真实开发工作流里的稳定性、成本效率,以及面对非标准化需求时的泛化能力。
《科创板日报》记者第一时间对GLM-5.3进行了数小时连续实测,检验其在复杂3D工程全链路任务上的端到端生成能力。记者要求模型以资深Three.js工程师兼分镜师的身份,从零交付一套完整产物:既要在浏览器中实现可交互的第三人称明亮风格开放世界Web Demo,还要复用同一场景资源离线逐帧渲染出60fps电影感宣传片,全程仅提供设计规格、素材清单与验收标准,所有代码完全由模型自主编写,此外,还要求做一个3D小游戏大闹天宫游戏的开发生成。
经过半小时左右的运行,GLM-5.3顺利完成了全流程任务输出,既生成了可直接在浏览器中加载运行的开放世界交互Demo代码,也同步产出了适配60fps帧率的电影感宣传片渲染脚本,整套交付物几乎无需人工二次调整即可落地运行,直观展现了其在复杂3D工程全链路任务上的端到端生成能力。


押注下一个场景
智谱在网络安全这条赛道上的布局,并非临时起意。据智谱方面对《科创板日报》记者介绍,其2025年9月就启动了网络安全方向研究,在GLM-5.2、GLM-5.3研发期间持续加码:搭建更多长程任务环境、更丰富的环境类型,并与国内安全实验室进行更专业的harness共创。
在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为84.5%,高于GLM-5.2的77.2%,也略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。
《科创板日报》记者获悉,GLM-5.3发布前两周,智谱联合清华、南开及多家头部安全团队开展密集红队测试,累计发现漏洞2404个,其中中高危1088个,覆盖220个项目,部分成果获微软致谢并进入CNVD、CNNVD官方披露流程。开放上先完成安全加固,限制潜在攻击能力、保留防御价值,核心敏感能力仅向受信验证用户开放,第三方评估确认其防御能力较强、漏洞利用难度高。
智谱为什么选择在这个节点重点投入网络安全方向?白润轩认为,网络安全是AI能力落地最刚性的场景之一,智谱在这个节点选择重投,看到的是供给严重不足和合规压力持续加大的双重需求。企业代码量爆炸式增长,防守方长期处于人力劣势。很多企业的安全团队规模有限,与此同时,数据安全法、关键信息基础设施保护条例等监管要求趋严,企业必须把安全审计嵌入开发流程,不能再靠事后补救,合规驱动的需求正在从金融、电信向政务、能源、医疗等领域快速扩散。
白润轩判断,智谱从2025年就开始布局这个方向,与国内头部安全实验室共建任务环境和评测框架,说明它不只是把安全当作模型能力的副产品,而是当作一个可商业化的垂直入口。未来安全能力很可能成为大模型在B端落地的重要抓手,尤其是在金融、电信、政务、能源这些对合规和攻防高度敏感的领域,AI驱动的自动化安全审计和漏洞挖掘有望填补人力缺口,改变攻防不对称的格局。
把镜头拉远,这是一盘更大的棋。基础模型能力日渐趋同之后,对基础模型公司而言,下一阶段的竞争不仅是模型能力之争,更是高价值场景之争。
一个值得注意的行业信号是:全球头部AI公司正在不约而同地把网络安全能力摆上货架。今年4月,Anthropic发布以安全能力为卖点的Claude Mythos,仅向约150家大型机构提供服务——安全能力被直接标价为面向大客户的商品;OpenAI则让模型专攻网络攻防评测,其"越狱"事件恰恰发生在这一过程中。
Gartner官方预测,2025年全球信息安全支出达2130亿美元,2026年将增至2400亿美元,其中安全软件增长最快,人工智能被列为支出增长的主要驱动因素。
能力的落点,最终指向商业化。Coding Agent、安全审计、企业服务,都可能成为基础模型公司下一阶段商业化的重要入口。
据介绍,智谱已同步上线官方编程工具ZCode、效率工具AutoClaw及GLM Coding Plan订阅服务,API很快上线,完整模型权重计划两周内开源。
