GLM-5.2 是旗舰级开源 GLM AI 模型:稳定的 100 万 token 上下文、非思考 / 高 / 最高三档思考力度,在 Terminal-Bench 2.1 上报告得分 81.0,FrontierSWE 上得分 74.4。下方可对比每款 GLM 模型 — 或先体验免费 AI 体验场。
无需注册、无需账号、无需额度。输入提示词即可获得流式回答。
回复将在此处流式输出…
本体验场使用 GLM 大语言模型,输入提示词即可获得实时流式回答。
四项能力定义了当前 GLM 模型世代 — 均由模型作者报告,可从开放权重复现。
100 万 token 上下文不仅可用,而且保持质量:GLM-5.2 在大规模实现、自动化研究和复杂调试等长上下文编码智能体轨迹上进行了训练。
非思考、高和最高三档让您按任务在延迟与能力之间权衡 — 在智能体编程评估上,约 63%(~35K 输出 token)到 74%(~83K)。
每四个稀疏注意力层共享一个轻量索引器,在 100 万上下文长度下将每 token FLOPs 降低 2.9 倍,长距离质量无损。
MIT 许可证下的开源 GLM 模型:权重发布在 HuggingFace 和 ModelScope,无地区限制,支持通过 transformers、vLLM、SGLang、xLLM 和 ktransformers 本地部署。
以下所有数据均为模型作者发布的 GLM-5.2 及对比模型的结果。glmmodel.net 仅做报告,不运行这些评估。
任务时长可达 20 小时
单张 H100 上最多 10 小时
超长周期软件工程,最多 10 小时
在三项长周期基准测试中,GLM-5.2 均为排名最高的开源模型 — 证明其百万上下文能转化为实际产出,而不仅仅是能接受的 token 数。在 FrontierSWE 上仅落后 Opus 4.8 一分,领先 GPT-5.5 一分,领先上一代 Opus 4.7 十一分。
已发布的 GLM 模型基准结果,涵盖 8 个模型的 17 项评估。
| 基准测试 | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| 推理 | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE(带工具) | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT 2025年11月 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT 2026年2月 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| 编程 | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1(最佳框架) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| 智能体 | ||||||||
| MCP-Atlas(公开集) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* 为完整数据集上的得分。
GLM 模型不是只有一种速度。思考力度控制让您仅在需要时分配更多计算资源。
~35K 平均 token
快速编辑、模板代码、常规重构等延迟比深度更重要的场景。
~43K 平均 token
大多数智能体编程的默认选择:以约一半的 token 消耗接近最高档的质量。
~83K 平均 token
困难的长周期问题 — 在任务确实需要时分配额外计算资源。
数据来自 Terminal-Bench 2.1、DeepSWE 和 SWE-Atlas QnA 的平均值,在 Claude Code 2.1.167 上评估。由模型作者报告。在相近的 token 预算下,GLM-5.2 的表现介于 Claude Opus 4.7 和 Opus 4.8 之间。
将上下文上限从 200K 提升到 100 万 token 是一个工程问题,而非配置参数。三项改动是关键。
每四个 Transformer 层共享一个轻量索引器。它位于四个层中的第一个,其 top-k 索引被其余三层复用 — 消除了四分之三层中的索引器点积和 top-k 计算。结果:在 100 万上下文长度下每 token FLOPs 降低 2.9 倍。从训练中期 128K 序列长度开始引入 IndexShare。
多 token 预测层在首个草稿步运行一次索引器,并在后续步骤中复用索引,消除了限制上一代的训练/推理 KV 缓存不匹配。结合拒绝采样和端到端 TV 损失,接受长度从 4.56 提升至 5.47 — 约 20% — 跨越 7 个 MTP 步骤。
| 基线 | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + 拒绝采样 | 5.29 |
| + 端到端 TV 损失 | 5.47 (+20%) |
超过几十万 token 后,瓶颈不再是计算,而是 KV 缓存容量、长上下文内核和 CPU 开销。三项修复:基于 LayerSplit 的细粒度内存管理和并行化、与缓存传输管道协调的上下文长度缩放内核优化,以及 CPU 侧缓存管理、请求调度和运行时路径调优。吞吐量优势随上下文增长而扩大。
归一化吞吐量优势
训练栈(slime)结合白盒和黑盒 rollout、紧凑轨迹和子智能体工作流。并行 OPD 训练在大约两天内合并了十余个专家模型,FP8 KV 缓存确保 rollout 内存不超预算。
长周期 RL 会诱生捷径,因此可疑动作先通过基于规则的召回过滤器,再经 LLM 裁判精确度检查。确认的黑客行为被在线拦截并以虚拟工具结果回应,使 rollout 得以继续而非被丢弃。基于 Critic 的 PPO 在单个 rollout 上保持压缩子轨迹的可训练性。
从 30B Flash 级别到百万上下文旗舰 — 选择一款 GLM 模型查看完整规格表和基准数据。
100 万 token 上下文,编程和长周期任务的开源 SOTA,更强的智能体工程能力。
上一代旗舰:大幅提升的长周期能力和数小时自主工作的工程级输出。
更强的编程能力、更可靠的多步执行和更好的复杂智能体行为。
基础模型,针对长链、动态智能体场景进行调优。
增强的编程能力、稳定的多步推理和改进的前端生成。
300 亿参数;高效高性能,领先于同规模开源模型。
小体积 GLM 模型,单位算力性能出色。
实时语音转文字识别,CER 低至 0.0717。
超越单个上下文窗口的多文件功能:模型将整个仓库状态保持在视野中,而不是每隔几轮重新读取。
数小时的实验循环,智能体需要规划、运行、读取结果和修正 — 这正是 FrontierSWE 和 PostTrainBench 设计来评估的工作负载。
需要完整调用图、分析器输出和先前尝试保持在同一轨迹中的内核和系统工作。
漫长的复现追踪、不稳定测试和跨服务故障,截断上下文正是丢失 Bug 的原因。
以上所有场景均可在您自己的硬件上运行 — MIT 权重,transformers · vLLM · SGLang · xLLM · ktransformers。如何本地运行 GLM 模型 →