新浪科技讯 8月14日下午消息,智谱今日发布新一代旗舰模型GLM-5.3。在基座模型与GLM-5.2相同的基础上,通过极致后训练Scaling,新模型在编程与智能体任务上实现了大幅跃升,并涌现出了更强的网络安全能力。
在多项基准测试中,GLM-5.3取得了开源模型第一的成绩。在内部体感评测中,其编程能力较前代提升50%。在多项主流基准测试中GLM-5.3是当前排名最高的开源模型,编程与智能体能力接近Claude Fable 5,编程体感超过其他国产模型。
在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents‘ Last Exam上,得分从23.8提升至28.5。
GLM-5.3展现出了出色的网络安全能力。在白盒代码审查与漏洞发现任务中,其表现持平行业标杆Mythos 5。在漏洞验证测试CyberGym中,GLM-5.3得分84.5%,高于GLM-5.2的77.2%。
据悉,上述全部提升都来自后训练。基于IndexShare、SAO、以及持续演进的新一代Slime框架,智谱在与GLM-5.2完全相同基座上推进强化学习,目前还远未开发出这个基座的智能上界。智谱将在两周后开放模型权重。(文猛)