GLM-5.2 - флагманская开源 GLM AI модель: стабильные 100000 контекстных token, три уровня мышления: Не думать / Высокий / Наивысший, на Terminal-Bench 2.1 был получен балл 81.0, на FrontierSWE - 74.4. Ниже можно сравнить каждую модель GLM - или сначала испытайте бесплатную AI платформу для тестирования.
Не требуется регистрация, учетная запись или квота. Введите ключевое слово, чтобы получить потоковый ответ.
Ответ будет streamed здесь...
Этот опыт использует большой языковой модель GLM, и вы можете получить потоковый ответ, введя ключевое слово.
Четыре способности определяют текущее поколение моделей GLM — все они сообщены авторами моделей и могут быть воспроизведены с помощью открытых прав.
100 万 Контекст token不仅可用,而且保持质量:GLM-5.2 在Масштабное внедрение、Автоматизированные исследования和Комплексная отладка等长上下文编码Искусственный интеллект轨迹上进行了训练。
Не думать、Высокий和Наивысший三档让您按任务在延迟与能力之间权衡 — 在Искусственный интеллектПрограммирование评估上,约 63%(~35K 输出 token)到 74%(~83K)。
Каждые четыре спarsity attention слоя делят один легковесный индексатор, что снижает FLOPs каждого token в 2,9 раза при длине контекста в 1 миллион, сохраняя качество на長距離無損。
MIT 许可证下的开源 Модель GLM:权重发布在 HuggingFace 和 ModelScope,无地区限制,支持通过 transformers、vLLM、SGLang、xLLM 和 ktransformers 本地部署。
Все данные, приведенные ниже, представляют собой результаты моделей GLM-5.2 и сравнительных моделей, опубликованные авторами моделей. glmmodel.net выполняет только функции отчета, не запуская эти оценки.
Длительность задачи до 20 часов
Максимально 10 часов на одном H100
Сверхдолгосрочное программирование, до 10 часов
В трех базовых тестах с длинным периодом GLM-5.2 занял Наивысшее место среди开源 моделей - это证明了其 миллион контекстных возможностей могут быть преобразованы в реальный результат, а не просто количество приемлемых token. На FrontierSWE он отстает от Opus 4.8 всего на один балл, опережает GPT-5.5 на один балл и на одиннадцать баллов опережает предыдущее поколение Opus 4.7.
Опубликованные базовые результаты моделей GLM, охватывающие 17 оценок для 8 моделей.
| Базовые тесты | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Дедукция | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE (с инструментами) | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT 2025 год, ноябрь | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT февраля 2026 года | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Программирование | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (лучший фреймворк) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Искусственный интеллект | ||||||||
| MCP-Atlas (открытый набор) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* Оценка на полных данных.
Модели GLM не имеют только одного уровня скорости. Функция управления усилием позволяет вам распределять дополнительные вычислительные ресурсы только при необходимости.
~35K средний token
Быстрая редактирование, шаблонный код, регулярное重构 и другие сценарии, где важнее задержка, чем глубина.
~43K средний token
Стандартный выбор для большинства агентов программирования: качество, близкое к самому высокому уровню, при消耗 около половины токенов.
~83K средний token
Трудные долгосрочные проблемы — распределяйте дополнительные вычислительные ресурсы только при необходимости.
数据来自 Terminal-Bench 2.1、DeepSWE 和 SWE-Atlas QnA 的平均值,在 Claude Code 2.1.167 上评估。由Модель作者报告。在相近的 token 预算下,GLM-5.2 的表现介于 Claude Opus 4.7 和 Opus 4.8 之间。
Повышение верхнего предела контекста с 200K до 1 миллиона token является инженерной проблемой, а не параметром конфигурации. Три изменения являются ключевыми.
每四个 Transformer 层Общий一个ЛегкийИндексатор。它位于四个层中的第一个,其 top-k 索引被其余三层复用 — 消除了四分之三层中的Индексатор点积和 top-k 计算。结果:在 100 万上下文长度下每 token FLOPs 降低 2.9 倍。从训练中期 128K 序列长度开始引入 IndexShare。
多 token 预测层在首个草稿步运行一次Индексатор,并在后续步骤中复用索引,消除了限制上一代的训练/Дедукция KV 缓存不匹配。结合拒绝采样和端到端 TV 损失,接受长度从 4.56 提升至 5.47 — 约 20% — 跨越 7 个 MTP 步骤。
| Базовый уровень | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Отказ от выбора | 5.29 |
| + Потеря TV от конца до конца | 5.47 (+20%) |
После более чем нескольких десятков тысяч token узким местом уже не является вычисление, а это KV кэш емкость, долгий контекст ядро и CPU затраты. Три ремонта: основанные на LayerSplit детализированная память управление и параллелизация, оптимизация ядра масштабирования длины контекста, согласованное с кэш передающей трубой, и управление кэшем, планирование запросов и оптимизация маршрутов в runtime. Преимущество производительности растет с увеличением контекста.
Преимущество нормализации производительности
训练栈(slime)结合白盒和黑盒 rollout、紧凑轨迹和子Искусственный интеллект工作流。并行 OPD 训练在大约两天内合并了十余个专家Модель,FP8 KV 缓存确保 rollout 内存不超预算。
长周期 RL 会诱生捷径,因此可疑动作先通过基于规则的召回过滤器,再经 LLM 裁判精确度检查。确认的黑客行为被在线拦截并以虚拟工具结果回应,使 rollout 得以继续而非被丢弃。基于 Critic 的 PPO 在单个 rollout 上保持压缩子轨迹的可训练性。
От 30B Flash уровня до миллиона контекстных токенов флагманского уровня — выберите модель GLM и посмотрите таблицу спецификаций и базовые данные.
Контекст в 1 миллион токенов,开源 SOTA для программирования и долгосрочных задач, более высокая инженерная способность агентов.
Предыдущее поколение флагмана: значительное улучшение долгосрочных способностей и инженерные результаты работы в течение нескольких часов.
Более высокая способность программирования, более надежное многошаговое выполнение и лучшее поведение сложных агентов.
Основная модель, оптимизированная для сценариев с длинными цепочками и динамическими интеллектуальными агентами.
Улучшенные программные возможности, стабильные многошаговые выводы и улучшенная генерация на переднем плане.
300 миллиардов параметров; высокая эффективность и производительность, лидирующие в同类 масштабных открытых моделей.
Маленький GLM модель, отличные показатели производительности на единицу вычислительной мощности.
Реальное преобразование голоса в текст в реальном времени, CER до 0,0717.
Функциональность работы с несколькими файлами, выходящими за пределы одного контекстного окна: модель поддерживает состояние всего репозитория в поле зрения, а не перечитывает его каждые несколько итераций.
数小时的实验循环,Искусственный интеллект需要规划、运行、读取结果和修正 — 这正是 FrontierSWE 和 PostTrainBench 设计来评估的工作负载。
Необходим полный вызов граф, вывод анализатора и сохранение ядра и системы на одном пути в предыдущих попытках.
Долгосрочное отслеживание воспроизведения, нестабильные тесты и跨сервисные сбои, обрезка контекста - это причина потери багов.
以上所有场景均可在您自己的硬件上运行 — MIT 权重,transformers · vLLM · SGLang · xLLM · ktransformers。Как запустить GLM-модель локально →
阅读 Модель GLMБазовые тесты,然后让真实Модель开始工作。上方的Площадка для тестирования免费且无需任何信息;如果您想要更完整的 AI 工具包,合作伙伴的免费套餐从这里开始。