Модели GLM —开源 AI для долгосрочных задач с миллионами контекстных токенов。

GLM-5.2 - флагманская开源 GLM AI модель: стабильные 100000 контекстных token, три уровня мышления: Не думать / Высокий / Наивысший, на Terminal-Bench 2.1 был получен балл 81.0, на FrontierSWE - 74.4. Ниже можно сравнить каждую модель GLM - или сначала испытайте бесплатную AI платформу для тестирования.

1M
Контекст token
С увеличением до 200K, стабильность при нагрузке на агента.
81.0
Terminal-Bench 2.1
Оценка GLM-5.2 увеличилась по сравнению с GLM-5.1 на 63.5.
MIT
Лицензия на открытом-source
Открытые веса, без региональных ограничений

Бесплатная зона для опыта AI — опыт реального开源 большого языкового модели

Не требуется регистрация, учетная запись или квота. Введите ключевое слово, чтобы получить потоковый ответ.

Ответ будет streamed здесь...

Этот опыт использует большой языковой модель GLM, и вы можете получить потоковый ответ, введя ключевое слово.

Ключевые способности семьи GLM-моделей

Четыре способности определяют текущее поколение моделей GLM — все они сообщены авторами моделей и могут быть воспроизведены с помощью открытых прав.

Стабильные миллионные контексты

100 万 Контекст token不仅可用,而且保持质量:GLM-5.2 在Масштабное внедрение、Автоматизированные исследования和Комплексная отладка等长上下文编码Искусственный интеллект轨迹上进行了训练。

Гибкость в力度思考а

Не думать、Высокий和Наивысший三档让您按任务在延迟与能力之间权衡 — 在Искусственный интеллектПрограммирование评估上,约 63%(~35K 输出 token)到 74%(~83K)。

Архитектура IndexShare

Каждые четыре спarsity attention слоя делят один легковесный индексатор, что снижает FLOPs каждого token в 2,9 раза при длине контекста в 1 миллион, сохраняя качество на長距離無損。

Открытые веса MIT

MIT 许可证下的开源 Модель GLM:权重发布在 HuggingFace 和 ModelScope,无地区限制,支持通过 transformers、vLLM、SGLang、xLLM 和 ktransformers 本地部署。

Результаты базового тестирования GLM 5.2: результаты для долгосрочных периодов

Все данные, приведенные ниже, представляют собой результаты моделей GLM-5.2 и сравнительных моделей, опубликованные авторами моделей. glmmodel.net выполняет только функции отчета, не запуская эти оценки.

Первый开源 модель
74.4%

FrontierSWE

Длительность задачи до 20 часов

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
Общий рейтинг на втором месте
34.3%

PostTrainBench

Максимально 10 часов на одном H100

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
Второй после серии Opus
13.0%

SWE-Marathon

Сверхдолгосрочное программирование, до 10 часов

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

В трех базовых тестах с длинным периодом GLM-5.2 занял Наивысшее место среди开源 моделей - это证明了其 миллион контекстных возможностей могут быть преобразованы в реальный результат, а не просто количество приемлемых token. На FrontierSWE он отстает от Opus 4.8 всего на один балл, опережает GPT-5.5 на один балл и на одиннадцать баллов опережает предыдущее поколение Opus 4.7.

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

Оценки GLM модели в 17 тестах базового уровня

Опубликованные базовые результаты моделей GLM, охватывающие 17 оценок для 8 моделей.

Результаты базового тестирования GLM, охватывающие каждое оценивание и модель.
Базовые тестыGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Дедукция
HLE40.531.041.437.037.749.8*41.4*45.0
HLE (с инструментами)54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT 2025 год, ноябрь94.494.095.084.494.496.596.594.8
HMMT февраля 2026 года92.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Программирование
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (лучший фреймворк)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Искусственный интеллект
MCP-Atlas (открытый набор)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* Оценка на полных данных.

Уровень мышления: без мышления, высокий и максимальный

Модели GLM не имеют только одного уровня скорости. Функция управления усилием позволяет вам распределять дополнительные вычислительные ресурсы только при необходимости.

Не думать

~63%

~35K средний token

Быстрая редактирование, шаблонный код, регулярное重构 и другие сценарии, где важнее задержка, чем глубина.

Наиболее часто используемые

Высокий

~72%

~43K средний token

Стандартный выбор для большинства агентов программирования: качество, близкое к самому высокому уровню, при消耗 около половины токенов.

Наивысший

~74%

~83K средний token

Трудные долгосрочные проблемы — распределяйте дополнительные вычислительные ресурсы только при необходимости.

数据来自 Terminal-Bench 2.1、DeepSWE 和 SWE-Atlas QnA 的平均值,在 Claude Code 2.1.167 上评估。由Модель作者报告。在相近的 token 预算下,GLM-5.2 的表现介于 Claude Opus 4.7 和 Opus 4.8 之间。

Как GLM-модель реализует миллион контекстных единиц?

Повышение верхнего предела контекста с 200K до 1 миллиона token является инженерной проблемой, а не параметром конфигурации. Три изменения являются ключевыми.

Редукция внимания IndexShare

每四个 Transformer 层Общий一个ЛегкийИндексатор。它位于四个层中的第一个,其 top-k 索引被其余三层复用 — 消除了四分之三层中的Индексатор点积和 top-k 计算。结果:在 100 万上下文长度下每 token FLOPs 降低 2.9 倍。从训练中期 128K 序列长度开始引入 IndexShare。

Общий обмен слоев GLM и IndexShare Слой N+3 Слой N+2 Слой N+1 Слой N Общий Индексатор

MTP в сочетании с IndexShare и KVShare

多 token 预测层在首个草稿步运行一次Индексатор,并在后续步骤中复用索引,消除了限制上一代的训练/Дедукция KV 缓存不匹配。结合拒绝采样和端到端 TV 损失,接受长度从 4.56 提升至 5.47 — 约 20% — 跨越 7 个 MTP 步骤。

Эксперимент по абляции длины MTP
Базовый уровень4.56
+ IndexShare + KVShare5.10
+ Отказ от выбора5.29
+ Потеря TV от конца до конца5.47 (+20%)

Эффективная служба для миллиона контекстов

После более чем нескольких десятков тысяч token узким местом уже не является вычисление, а это KV кэш емкость, долгий контекст ядро и CPU затраты. Три ремонта: основанные на LayerSplit детализированная память управление и параллелизация, оптимизация ядра масштабирования длины контекста, согласованное с кэш передающей трубой, и управление кэшем, планирование запросов и оптимизация маршрутов в runtime. Преимущество производительности растет с увеличением контекста.

Преимущество нормализации производительности

Обучение агента с помощью методов 强化 обучения

训练栈(slime)结合白盒和黑盒 rollout、紧凑轨迹和子Искусственный интеллект工作流。并行 OPD 训练在大约两天内合并了十余个专家Модель,FP8 KV 缓存确保 rollout 内存不超预算。

Противоположные хакеры

长周期 RL 会诱生捷径,因此可疑动作先通过基于规则的召回过滤器,再经 LLM 裁判精确度检查。确认的黑客行为被在线拦截并以虚拟工具结果回应,使 rollout 得以继续而非被丢弃。基于 Critic 的 PPO 在单个 rollout 上保持压缩子轨迹的可训练性。

Каждая GLM-модель, описание по версиям

От 30B Flash уровня до миллиона контекстных токенов флагманского уровня — выберите модель GLM и посмотрите таблицу спецификаций и базовые данные.

GLM-5.2ФлагманНовый

Контекст в 1 миллион токенов,开源 SOTA для программирования и долгосрочных задач, более высокая инженерная способность агентов.

GLM-5.1Дедукция

Предыдущее поколение флагмана: значительное улучшение долгосрочных способностей и инженерные результаты работы в течение нескольких часов.

GLM-5Дедукция

Более высокая способность программирования, более надежное многошаговое выполнение и лучшее поведение сложных агентов.

GLM-5-TurboДедукция

Основная модель, оптимизированная для сценариев с длинными цепочками и динамическими интеллектуальными агентами.

GLM-4.7Дедукция

Улучшенные программные возможности, стабильные многошаговые выводы и улучшенная генерация на переднем плане.

GLM-4.7-FlashЛегкий

300 миллиардов параметров; высокая эффективность и производительность, лидирующие в同类 масштабных открытых моделей.

GLM-4.5-AirЛегкий

Маленький GLM модель, отличные показатели производительности на единицу вычислительной мощности.

GLM-ASRГолос

Реальное преобразование голоса в текст в реальном времени, CER до 0,0717.

Перейти к просмотру всех GLM-моделей →

Сцены, где блестит долгосрочный GLM-модель

Масштабное внедрение

Функциональность работы с несколькими файлами, выходящими за пределы одного контекстного окна: модель поддерживает состояние всего репозитория в поле зрения, а не перечитывает его каждые несколько итераций.

Автоматизированные исследования

数小时的实验循环,Искусственный интеллект需要规划、运行、读取结果和修正 — 这正是 FrontierSWE 和 PostTrainBench 设计来评估的工作负载。

Оптимизация производительности

Необходим полный вызов граф, вывод анализатора и сохранение ядра и системы на одном пути в предыдущих попытках.

Комплексная отладка

Долгосрочное отслеживание воспроизведения, нестабильные тесты и跨сервисные сбои, обрезка контекста - это причина потери багов.

以上所有场景均可在您自己的硬件上运行 — MIT 权重,transformers · vLLM · SGLang · xLLM · ktransformers。Как запустить GLM-модель локально →

Частые вопросы о модели GLM

GLM - это семья больших языковых моделей с открытыми весами, текущий флагман - GLM-5.2. Линия продуктов включает GLM-4.5-Air и GLM-4.7, GLM-5, GLM-5-Turbo, GLM-5.1 и текущий GLM-5.2, а также голосовые и визуальные вариации. Каждая основная модель GLM выпущена под лицензией MIT, весы полностью открыты.

GLM-5.2 поднимает верхний предел с 200K до стабильных 1000000 token, максимальное количество token в выводе 128K. "Стабильность" - это ключевые слова: Модель была обучена на искусственном интеллекте и долгосрочных задачах, поэтому качество сохраняется в течение всего окна, а не ухудшается при усложнении выполнения.

Опубликованные результаты включают Оценка Terminal-Bench 2.1 81.0, Оценка SWE-bench Pro 62.1, FrontierSWE балл 74.4, PostTrainBench балл 34.3, Оценка DeepSWE 46.2, Оценка MCP-Atlas 76.8 и AIME 2026 балл 99.2 - в трех долгосрочных оценках модель занимает Наивысшее место среди开源 моделей. Полная таблица видна выше.

Зависит от задачи. GLM-5.2 лидирует на FrontierSWE, PostTrainBench и Terminal-Bench 2.1 перед GPT-5.5, на всех Программирование операциях лидирует перед Gemini 3.1 Pro, а Claude Opus 4.8 по-прежнему лидирует на SWE-bench Pro, NL2Repo и SWE-Marathon. В рамках фреймворка Claude Code, GLM-5.2 набрал 82.7, а Opus 4.8 набрал 78.9.

它们控制Модель在每个任务上消耗多少计算资源。在Искусственный интеллектПрограммирование评估上,报告曲线约为 63%(~35K 输出 token,Не думать)、72%(~43K,Высокий)和 74%(~83K,Наивысший)。Высокий是实用的默认选择;Наивысший用于真正困难的长周期问题。

Да. Веса основной модели GLM используются под лицензией MIT, без географических ограничений, и уже опубликованы на HuggingFace и ModelScope. Поддерживается локальная дедукция через transformers, vLLM, SGLang, xLLM и ktransformers, и вы можете запускать модель GLM на своем собственном оборудовании.

IndexShare позволяет каждому из четырех спarsity attention layer Общий легкий индексатор, его top-k индекс рассчитывается один раз и затем повторно используется. Это устраняет работу индексатора в трети слоев, в миллион контекста снижает количество FLOPs на каждый token в 2,9 раза — это ключевые изменения, позволяющие миллион token окну быть возможным на уровне обслуживания.

Бесплатная и开源 большая языковая Модель, предоставляемая через OpenRouter — это не GLM-5.2, и не использует вес GLM. Ее наличие позволяет вам тестировать реальную Модель в реальном времени при чтении опубликованных данных Модель GLM. Все базовые данные GLM на этом сайте являются результатами, сообщенными авторами Модели, а не измеренными здесь.

Бесплатный опыт реальной AI модели — без необходимости создания аккаунта

阅读 Модель GLMБазовые тесты,然后让真实Модель开始工作。上方的Площадка для тестирования免费且无需任何信息;如果您想要更完整的 AI 工具包,合作伙伴的免费套餐从这里开始。