刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness
9759点击    2026-08-14 17:04

编程与智能体能力接近Claude Fable 5。


智东西8月14日报道,就在刚刚,智谱发布了其最新一代旗舰模型GLM-5.3,并宣布模型将在两周内开源。这是一个拥有7430亿个参数的模型,和此前的GLM模型一样主打编程。


在多项主流基准测试中,GLM-5.3位居所有已开源或即将开源模型中的第一;其在编程与智能体任务上的能力,已逼近Claude Fable 5、GPT-5.6 Sol等海外顶尖模型


与国内模型相比,GLM-5.3与Kimi K3在编程和智能体领域互有胜负,并在绝大部分基准测试中领先DeepSeek-V4-Pro-0813。而在网络安全能力方面,GLM-5.3则展现出一定优势,领先于另外两款国产模型。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


同时,GLM-5.3还在能力和token效率之间取得了更好的平衡。在相同的高档位思考预算下,GLM-5.3的准确率达到31.5%,超过Claude Opus 4.8的29.5%,任务平均输出约5万个token,不到Opus 4.8平均输出量的一半。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


智东西在发布前获得了GLM-5.3的内测资格,得以提前深度体验这款模型在真实开发场景中的完整能力。在我们的实测中,GLM-5.3+ZCode的组合不仅能从0到1开发一款以真实地图数据1:1复刻上海陆家嘴至外滩区域的3D开放世界驾驶游戏,还能“裸考”DeepSeek刚开源的Harness框架:在零先验的条件下读懂这个超7000个文件的代码仓库,再按它的规矩打造出一个“人格插件”。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


除了编程能力之外,智谱称GLM-5.3在充分的预训练之后,还涌现出了不错的网络安全能力,在与国内高校、企业的合作中,GLM-5.3用两周时间揪出了2436个漏洞。在白盒代码审查与漏洞推理等安全任务中,GLM-5.3的表现与Claude Mythos 5接近。


目前,GLM-5.3已上线智谱的AI编程工具Zcode、效率工具AutoClaw,支持通过GLM Coding Plan使用。同时,这一模型还在TraeWork、WorkBuddy、Qoder、OpenCode等平台开放了抢先体验。


智谱称,GLM-5.3的API将很快上线。同时,在模型开源之前,GLM-5.3还将完成安全评估、安全加固,以限制其在网安领域的潜在攻击能力,保留其防御价值。


体验链接:


https://zcode.z.ai/en


博客链接:


https://z.ai/blog/glm-5.3


拿真实数据1:1复刻外滩建筑群


还做了个开放世界驾驶游戏


此次测试,我们用到了智谱最近更新的ZCode,搭配旗舰模型GLM-5.3。我们交给GLM-5.3的第一个任务是一份有难度的产品需求文档:以真实的OpenStreetMap数据为基础,开发一款上海陆家嘴至外滩区域的3D开放世界驾驶游戏。


文档中要求,地图解析、坐标转换和游戏逻辑等关键模块全部让模型“手写”,只允许使用Three.js的底层渲染能力。为了测试模型在长任务中的记忆可靠性,我们还在文档中部埋下了两条“陷阱条款”,包括凌晨两点到四点外滩建筑灯光熄灭一半,以及地图边缘需要设置带有提示的软性阻挡。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


GLM-5.3拿到需求后先验证了数据的真实形态。它编写脚本从Overpass API拉取了8万多个OSM节点,先做了一轮数据勘查,确认地图数据的完整性后,才开始开发。


整个开发过程持续了多轮,最终交付了约4900行代码,覆盖数据管线、车辆物理、车辆音效、导航、昼夜循环和存档系统,两条埋雷条款在最终验收中全部通过。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


开发过程中,可以观察到GLM-5.3排查问题的思路很清晰。测试早期,游戏页面完全卡死,它没有盲目改动代码,而是给本地服务器加了请求探针,通过面包屑日志定位到问题。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


在精准定位后,GLM-5.3修复bug的效率得到了提升。比如,当我提出游戏相机视角存在问题,有时会穿过建筑时,GLM-5.3从这条模糊的描述出发,统计出全部6300多栋建筑中有大约4成的轮廓环绕方向与墙面法线约定相反,从而导致了上述问题,实际修复只改了几行代码。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


因为测试环境无法直接目检画面,它甚至自己写了一个零依赖的PNG解码器,用像素统计来客观证明水面、标线和夜间灯光确实被正确渲染。


值得一提的是,搭配ZCode使用时,整个对话的平均缓存命中率达超过了99%,可以节省不少钱。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


不过,在这一项目的开发过程中,我们也发现了GLM-5.3的一些短板。工程能力之外,它的审美判断还有提升空间,建筑贴图和道路标线的观感先后经过四轮人工反馈,还是没能达到预期,略显简陋。


总体来看,GLM-5.3搭配ZCode基本可以顺利完成用户交代的开发任务,但用户仍需要给模型提供一定的反馈,才能打磨出更好的交付物。


读懂超7000个文件


连夜打造DeepSeek Harness“人格插件”


如果说驾驶游戏考察的是GLM-5.3从零创造的交付能力,第二项实测考察的则是另一个方向:面对一个完全陌生的大型代码仓库,能否读懂它,再按它的规矩改造它。


我们的测试对象是DeepSeek昨天刚刚开源的DeepSeek Harness,一个采用“一切皆插件”架构的智能体框架。这个monorepo包含40多个顶层包、200多个工作区项目、7400多个文件


对GLM-5.3来说,这是一次“裸考”:DeepSeek Harness仓库发布仅一天,它的训练数据里不可能有任何相关信息,对这个框架的全部认识只能来自现场摸索。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


第一项任务是仓库级理解。我们向GLM-5.3询问,用户执行dsh web之后,从进程启动到第一条消息抵达模型,中间经过哪些模块,插件如何加载,出错时又如何兜底。


面对这种体量的代码仓库,GLM-5.3派出了4个并行探索子智能体,分别追查CLI入口、插件机制、模型契约与消息通路,再把四份结论汇成一份链路报告,并回头逐条核对关键代码。这些文件的跨度较大,而GLM-5.3成功地找到了它们之间的联系。


报告的关键结论有三条:插件的装配依据一份YAML清单逐行登记,不存在目录扫描式的自动发现;顺着这条线索,它锁定了LlmAdapter这份所有模型提供方共同遵守的契约;启动失败时的策略是快速失败,而非静默跳过。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


在此基础上,我们进一步要求GLM-5.3为DeepSeek Harness开发一个“人格插件”,让AI的回复可以在文言文、东北话与猫语之间切换。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


这项任务的难点在于要做到“零侵入”:我们要求GLM-5.3开发的结果功能要生效,但框架的原有行为不能变,插件关闭要立刻复原。


GLM-5.3先派出2个探索子智能体并行通读仓库,约5分钟后各自提交报告,研究页面交互方案时又派出第3个,3个子智能体合计消耗约690万token。规范摸清后,它选定系统提示注册表作为注入口:指令随系统层下发,用户消息没有改动;插件卸载后注册表自行摘除。


下方是GLM-5.3最终交付的插件效果。可以看到这个插件的交互体验是比较原生的,可以与DeepSeek Harness的其他插件出现在同一个菜单栏中,切换后语言风格的确符合要求。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


再来看看具体的执行过程。初版交付涉及20个文件、净增560行,除代码外还包含双语文档配对记录与重新生成的依赖图。同时,配套的11条单元测试一次通过,覆盖开启注入、关闭复原与三人格路由等功能。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


不过,在跑全量回归的时候出现了一段插曲:771个测试文件中有6个失败。为排查问题,GLM-5.3先将自己的改动整体撤下,在干净基线上重跑同一批用例,失败原样复现。据此,它确认问题源于本机环境,与新增代码无关。


在解决环境问题后,应我们要求,GLM-5.3复用了DeepSeek Harness既有的命令机制,将人格切换接入网页端,键入一条斜杠命令即可切换人格,前端基本没有新增代码,28项文档门禁与937对双语文档检查全数通过。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


从结果看,GLM-5.3在本轮实测中的长板是任务拆解、跨包溯源与代码引用,以及对陌生工程规范的理解和遵循,对照实验的处置方式也比较严谨。


不过,体验时我们也发现,ZCode在一些长任务执行期间存在反馈不足,我们一度以为进程中断,人工打断了执行。同时,对于一些风险很低的修改,GLM-5.3也会跑完整的检查与测试,这在有些场景下可能会带来不必要的token消耗。


DSH“人格插件”开源地址:


https://github.com/chenjunda0018-sketch/A-persona-plugin-for-DeepSeek-Harness


能力提升来自后训练Scaling


网安能力涌现


智谱在GLM-5.3博客中,详细介绍了这款模型在技术方面的思考。


GLM-5.3的基座模型与GLM-5.2完全一致,其能力提升主要来自于后训练的Scaling。GLM-5.3在后训练过程中经历了更长的任务环境,更丰富的环境类型,后训练时间也明显加长。


随着任务环境的不断丰富,智谱还观察到GLM-5.3涌现出超预期的网络安全能力。


例如,在白盒源代码安全基准测试CyberGym中,GLM-5.3得分为84.5%,超过GLM-5.2(77.2%)、Claude Mythos 5(83.8%)、GPT-5.6 Sol(83.6%)。在更接近完整漏洞利用的ExploitGym测试中,2小时内,Mythos 5完成了181个任务,GLM-5.3完成105个任务,达到Mythos 5约58%的水平,相比GLM-5.2的29项提升明显。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


GLM-5.3发布前两周,智谱联合清华大学、南开大学,以及云起无垠、绿盟科技、赛博昆仑、DARKNAVY、华顺信安、奇安信、腾讯玄武、云鼎实验室等多家安全团队,开展了密集的红队测试与安全评估。


相关测试最终在2周内累计发现漏洞2436个(经过初筛、去重),其中1097个为中高危,最早可追溯至约45年前,代表性漏洞覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等269个项目,相关漏洞均已报送国家CNNVD/CNVD国家漏洞库,为提高披露过程的透明度,智谱建立了Z.ai安全披露账本,记录漏洞从发现、确认到修复的全过程。


刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness


执行效率方面,智谱自GLM-5.2开始引入effort level(思考档位)控制。智谱称,在相近Token预算下,GLM-5.3在任务完成质量、执行速度和使用成本之间取得了更好的平衡。


结语:智谱、DeepSeek等纷纷重押后训练


不换基座也能换代


从我们的实测来看,GLM-5.3已经能在真实工程现场交出完整的交付物;而审美判断等短板,或许可以成为下一轮后训练继续打磨的方向。


后训练这条路线近期的受益者不止智谱一家:DeepSeek-V4正式版能力的大幅提升,同样与后训练阶段的投入有关。在预训练的数据与算力红利逐渐见顶之后,后训练正成为头部模型厂商进一步提升性能的关键方向,其潜力很可能还未被充分挖掘。


文章来自于微信公众号 “智东西”,作者 “智东西”

关键词: AI新闻 , GLM-5.3 , 智谱 , 人工智能
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md