GLM-5 SWE-bench Pro 62.1分深度解读:开源SWE修复能力真相
GLM-5 SWE-bench Pro 62.1分深度解读开源SWE修复能力真相【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5GLM-5 系列旗舰模型 GLM-5.2 在 SWE-bench Pro 上取得 62.1 分登顶开源大模型 SWE 代码修复能力榜。这篇文章带你读懂这个分数背后的真相它测的是什么、与闭源前沿差多少、开源第一意味着什么以及新手如何快速上手部署 GLM-5 系列。SWE-bench Pro 是什么62.1 分意味着什么 先说结论62.1 分是当前开源模型在 SWE-bench Pro 上的最高分比 GPT-5.558.6高出 3.5 分比 Gemini 3.1 Pro54.2高出近 8 分。SWE-bench 系列是业界公认的SWE 修复能力标尺考察模型能否像工程师一样读懂仓库代码 → 定位真实 Bug → 写出补丁 → 通过测试。而SWE-bench Pro 是其中最硬核的版本——题目来自更复杂的真实工业级仓库语言覆盖更广对模型的长程推理、代码定位与多轮迭代能力要求更高。上图为 GLM-5.2 在 8 项基准上的完整成绩所有模型均以最大思考力度评测。可以看到除了 SWE-bench Pro 的 62.1GLM-5.2 在 Terminal-Bench 2.1 上更是拿下81.0 分与 Claude Opus 4.885.0仅差 4 分。数据来源README_zh.md 中的官方评测说明读懂 62.1一张表看透开源 vs 闭源差距基准测试GLM-5.2Claude Opus 4.8GPT-5.5Gemini 3.1 ProSWE-bench Pro62.169.258.654.2Terminal-Bench 2.181.085.084.074.0DeepSWE46.258.058.010.0MCP-Atlas77.077.875.369.2 三个关键信号开源第一且优势扩大对比上一代 GLM-5.1 的 58.4 分GLM-5.2 一次提升了 3.7 分拉开与同类开源模型的差距。闭源差距缩至 7.1 分69.2 vs 62.1在两年前的开源圈几乎是不可想象的数字。Terminal-Bench 2.1 接近追平81.0 对 85.0说明 GLM-5 系列的智能体工程能力已贴近闭源天花板。54.9 → 62.1GLM-5 系列是如何一路爬升的62.1 分并非一蹴而就而是 GLM-5 系列三代进化的结果。上图展示的是 GLM-5.1 时期的编码评测SWE-Bench Pro 54.9当时已是开源领先而 GLM-5.2 在此基础上再上台阶。1️⃣ 规模翻倍744B 参数 稀疏注意力相比 GLM-4.5GLM-5 将参数从 355B激活 32B扩展到744B激活 40B预训练数据从 23T 增至28.5T tokens。更妙的是集成了 DeepSeek 稀疏注意力DSA让长上下文部署成本大幅降低——这也是它敢冲击 1M token 上下文的底气。2️⃣ slime异步强化学习基础设施传统 RL 训练太慢撑不起大规模后训练。GLM 团队自研了 slime 异步 RL 框架大幅提升训练吞吐让更细粒度的后训练迭代成为可能——这是 SWE 修复这类长链路任务能持续提分的关键。3️⃣ 从 Vibe Coding 到 Agentic EngineeringGLM-5 系列最核心的进化不是写对一行代码而是长程智能体能力拆解复杂问题、设计实验、读结果、定位瓶颈并在数百轮迭代、数千次工具调用中持续优化——运行越久结果越好。上图为 GLM-5 首代模型的全面成绩单SWE-bench Verified 77.8、SWE-bench Multilingual 73.3、t²-Bench 89.7在开源模型中处于第一梯队与 Claude Opus 4.5 的差距已非常有限。从榜单到真实工程GLM-5 的实战表现榜单分数之外官方还准备了更贴近真实工作场景的验证。在内部评估套件CC-Bench-V2上GLM-5 在前端构建成功率达到98.0%超越 Claude Opus 4.5 的 93.0%大仓库探索能力 65.6%长程多步链式任务 52.3%——均优于上一代 GLM-4.7并与闭源旗舰掰手腕。更有趣的验证是Vending Bench 2让模型在一年时间跨度里经营一个模拟自动售货机生意。GLM-5 最终账户余额$4,432开源第一直逼 Claude Opus 4.5 的 $4,967。能赚钱才说明规划、资源管理和抗干扰能力是真的。新手快速上手GLM-5 系列部署指南 不需要写一行代码你也能用起来模型获取GLM-5 全系列GLM-5 / 5.1 / 5.2均为 744B-A40B 的 MoE 架构提供BF16 与 FP8两种精度可同时在 Hugging Face 与 ModelScope 两大模型平台下载。FP8 版本显存占用更低适合资源有限的环境。主流部署框架官方验证了以下推理框架详见 README.md框架最低版本适合场景SGLangv0.5.13.post1高性能生产部署vLLMv0.23.0通用推理服务Transformersv0.5.12快速原型验证KTransformersv0.5.12消费级硬件混合推理Unslothv0.1.47-beta量化与微调若使用Ascend NPU平台官方提供了完整部署示例涵盖 MoE 算子融合、PD 分离、W8A8 量化等 7 项优化可参考 example/ascend.md。关键参数思考力度GLM-5 支持reasoning_effort参数控制思考力度分max与high两档默认即为max——复现榜单成绩无需任何设置追求低延迟时可显式传reasoning_efforthigh设置enable_thinkingfalse可完全关闭思考。微调与技能生态微调支持 SlimeGLM 团队同款 RL 框架与 ms-swift支持 SFT / PPO / GRPO仓库内附赠 skills/glm-master-skill/SKILL.md是 GLM 生态技能OCR、图像生成、视觉理解等的导航总览许可协议见 LICENSE可自由用于研究与商业场景常见问题速答QSWE-bench Pro 62.1 分是 GLM-5 还是 GLM-5.2A62.1 分来自系列最新旗舰GLM-5.2最大思考力度评测前代 GLM-5.1 为 58.4 分。GLM-5 作为系列首代在 SWE-bench Verified 上得 77.8 分。Q与闭源模型还有多大差距ASWE-bench Pro 差 7.1 分62.1 vs 69.2DeepSWE 差 11.8 分仍是短板但在 Terminal-Bench 2.1 上仅差 4 分部分真实工程指标前端构建成功率已反超。Q个人开发者值得本地部署吗A744B 参数对显存要求不低推荐 FP8 版本 KTransformers 混合推理方案也可直接通过 API 平台调用 GLM-5.2 服务是新手最快上手的姿势。总结62.1 分不只是开源第一的标题它标志着三件事开源 SWE 修复能力进入 60 时代、与闭源前沿差距压缩到个位数、Agentic Engineering 取代单点代码生成成为竞争主线。对新手而言现在正是用 GLM-5 系列体验会自主修 Bug 的 AI 工程师的最佳时机——下载 FP8 权重、跑通 SGLang或直接用 API半小时即可上手。【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

日新闻

周新闻

月新闻