Modelo GLM — AI de 1 milhão de tokens de contexto aberto para tarefas de longo prazo

O GLM-5.2 é um Modelo de IA GLM de código aberto de nível Flagship: com 1 milhão de Contexto de token estável, três níveis de Força de pensamento (Não pensar / Alto / Máximo), e obteve uma pontuação de 81.0 no Terminal-Bench 2.1 e 74.4 no FrontierSWE. Abaixo, você pode Comparar cada Modelo GLM — ou experimentar gratuitamente a Cena de experiência AI.

1M
Contexto de token
Aumento de 200K, mantendo-se estável sob carga de agente inteligente
81.0
Terminal-Bench 2.1
Pontuação do GLM-5.2, com melhoria em 63,5 em comparação com o GLM-5.1
MIT
Licença de código aberto
Peso aberto, sem restrições regionais

Acesso gratuito ao campo de experiência AI — experimente o modelo de grande linguagem open-source em tempo real

Sem registro, sem conta, sem limite. Insira palavras-chave de entrada para obter respostas em fluxo.

A resposta será transmitida em streaming aqui...

Esta experiência utiliza o modelo de grande linguagem GLM, insira palavras-chave de entrada para obter respostas em tempo real.

Capacidades centrais da família de modelos GLM

Quatro capacidades definem a geração atual de modelos GLM — todas relatadas pelos autores do modelo e reproduzíveis a partir de direitos abertos.

Contexto estável de milhões

O contexto de token não só é disponível, mas mantém qualidade: o GLM-5.2 foi treinado na trilha do Agente Inteligente de Codificação de Longo Contexto, incluindo Implementação em Escala Ampla, Pesquisa Automatizada e Depuração Complexa.

Força de pensamento flexível

Não pensar、Alto和Máximo三档让您按任务在延迟与能力之间权衡 — 在Agente inteligenteProgramação评估上,约 63%(~35K 输出 token)到 74%(~83K)。

Arquitetura IndexShare

Cada quatro camadas de atenção esparsa compartilham um indexador leve, reduzindo os FLOPs de cada token em 2,9 vezes sob uma extensão de contexto de 1 milhão de tokens, mantendo a qualidade de longo alcance inalterada.

Peso de código aberto do MIT

Modelo GLM Open Source sob licença MIT: pesos publicados em HuggingFace e ModelScope, sem restrições geográficas, suportando implantação local via transformers, vLLM, SGLang, xLLM e ktransformers.

Resultados de longa duração do teste de referência do GLM 5.2

Todos os dados a seguir são resultados de modelos GLM-5.2 e comparativos publicados pelos autores dos modelos. glmmodel.net apenas realiza relatórios, não executando essas avaliações.

Primeiro modelo de código aberto
74.4%

FrontierSWE

Tempo de tarefa até 20 horas

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
Classificação geral em segundo lugar
34.3%

PostTrainBench

Até 10 horas em uma única H100

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
Segundo apenas à série Opus
13.0%

SWE-Marathon

Engenharia de software de longo prazo, até 10 horas

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

No teste de referência de longa duração de três itens, o GLM-5.2 é o Modelo de código aberto com a melhor classificação — provando que seu milhão de contexto pode ser convertido em produção real, e não apenas em um número aceitável de tokens. No FrontierSWE, ficou apenas um ponto atrás do Opus 4.8, um ponto à frente do GPT-5.5 e onze pontos à frente do Opus 4.7 da geração anterior.

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

Pontuações do modelo GLM em 17 testes de referência

Resultados de benchmark publicados para modelos GLM, cobrindo 17 avaliações de 8 modelos.

Resultados de referência publicados do modelo GLM, cobrindo cada avaliação e modelo.
Teste de referênciaGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Raciocínio
HLE40.531.041.437.037.749.8*41.4*45.0
HLE (com ferramentas)54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT 2025 de novembro94.494.095.084.494.496.596.594.8
HMMT Fevereiro de 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Programação
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (melhor framework)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agente inteligente
MCP-Atlas (conjunto público)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* Pontuação para o conjunto de dados completo.

Força de pensamento: sem pensamento, alta e mais alta

Os modelos GLM não têm apenas uma velocidade. O controle de força de pensamento permite que você distribua mais recursos de computação apenas quando necessário.

Não pensar

~63%

~35K token médio

Edição rápida, código de modelo, refatoração convencional e outras situações onde a latência é mais importante do que a profundidade.

Mais usado

Alto

~72%

~43K token médio

Escolha padrão para a programação de agentes inteligentes: com cerca de metade do consumo de tokens, se aproxima da qualidade de topo.

Máximo

~74%

~83K token médio

Problemas de longo prazo difíceis — distribua recursos de computação adicionais apenas quando necessário para a tarefa.

Os dados são a média do Terminal-Bench 2.1, DeepSWE e SWE-Atlas QnA, avaliados no Claude Code 2.1.167. Relatados pelo autor do Modelo. Com um orçamento de token semelhante, o desempenho do GLM-5.2 está entre o Claude Opus 4.7 e o Opus 4.8.

Como o modelo GLM realiza milhões de contextos?

Aumentar o limite de contexto de 200K para 1 milhão de tokens é um problema de engenharia, não um parâmetro de configuração. Três mudanças são cruciais.

Atenção esparsa IndexShare

Cada quatro camadas do Transformer compartilham um LeveIndexador. Ele está localizado na primeira camada entre as quatro, e seu índice top-k é reused pelos outros três níveis — eliminando o ponto de Indexador e o cálculo top-k em um quarto das camadas. Resultado: cada token reduz a FLOPs em 2.9 vezes sob uma extensão de contexto de 1 milhão. O IndexShare foi introduzido a partir do meio do treinamento com uma extensão de sequência de 128K.

Compartilhamento de camadas do modelo GLM e IndexShare Camada N+3 Camada N+2 Camada N+1 Camada N Compartilhado Indexador

MTP em conjunto com IndexShare e KVShare

A camada de predição de múltiplos token executa uma vez o Indexador no primeiro passo do rascunho e reutiliza o índice nos passos subsequentes, eliminando a incompatibilidade de cache KV de treinamento/Raciocínio da geração anterior. Com a combinação de amostragem rejeitada e perda TV de extremo a extremo, a aceitação de comprimento aumenta de 4.56 para 5.47 — cerca de 20% — ao longo de 7 passos MTP.

Experimento de Ablação de Comprimento de MTP
Baseline4.56
+ IndexShare + KVShare5.10
+ Recusa de amostragem5.29
+ Perda de TV de extremo a extremo5.47 (+20%)

Serviço eficiente para milhões de contextos

Depois de mais de alguns milhões de token, o gargalo não é mais a computação, mas a capacidade de cache KV, o núcleo de contexto longo e o consumo de CPU. Três correções: gerenciamento de memória de alta granularidade e paralelização baseados em LayerSplit, otimização do núcleo de escalonamento de comprimento de contexto em coordenação com o pipeline de transmissão de cache, e otimização de gerenciamento de cache, agendamento de solicitações e ajustes de caminho de execução do lado de CPU. A vantagem de capacidade de processamento aumenta à medida que o contexto cresce.

Vantagem de taxa de escoamento normalizada

Treinamento de aprendizado por reforço de agente

训练栈(slime)结合白盒和黑盒 rollout、紧凑轨迹和子Agente inteligente工作流。并行 OPD 训练在大约两天内合并了十余个专家Modelo,FP8 KV 缓存确保 rollout 内存不超预算。

Hackers de recompensa reversa

O RL de longo prazo pode gerar atalhos, portanto, ações suspeitas são primeiramente filtradas por um filtro de recall baseado em regras, seguidas por uma verificação de precisão do juiz LLM. Ações de hacker confirmadas são interceptadas online e respondidas com resultados de ferramentas virtuais, permitindo que o rollout continue em vez de ser descartado. O PPO baseado em Critic mantém a treinabilidade das sub-trilhas compactadas em um único rollout.

Cenários onde o modelo GLM brilha com longos períodos

Implementação em larga escala

Função de múltiplos arquivos que ultrapassa a janela de contexto única: o modelo mantém o estado do repositório inteiro na visão, em vez de ler novamente a cada algumas rodadas.

Pesquisa automatizada

数小时的实验循环,Agente inteligente需要规划、运行、读取结果和修正 — 这正是 FrontierSWE 和 PostTrainBench 设计来评估的工作负载。

Otimização de desempenho

Necessário para um gráfico de chamadas completo, saída do analisador e tentativas anteriores para manter o núcleo e o trabalho do sistema na mesma trajectória.

Depuração complexa

Uma longa rastreamento de reprodução, testes instáveis e falhas transversais de serviço, a truncagem do contexto é a razão pela qual o Bug foi perdido.

以上所有场景均可在您自己的硬件上运行 — MIT 权重,transformers · vLLM · SGLang · xLLM · ktransformers。Como executar localmente o modelo GLM →

Perguntas frequentes sobre o modelo GLM

O GLM é uma família de Modelos de grande linguagem de peso aberto, com o GLM-5.2 como o Flagship atual. A linha de produtos vai do GLM-4.5-Air e GLM-4.7 ao GLM-5, GLM-5-Turbo, GLM-5.1 e agora o GLM-5.2, incluindo variantes de Voz e Visão. Cada Modelo GLM nuclear é lançado sob a licença MIT, com pesos completamente abertos.

O GLM-5.2 elevou o limite de 200K para um token estável de 1 milhão, com uma saída de token de até 128K. "Estável" é a chave: o Modelo foi treinado na trilha do Agente Inteligente de Codificação de Longo Contexto, mantendo a qualidade constante ao longo da janela, em vez de degradar quando a complexidade aumenta.

Os resultados publicados incluem a Pontuação do Terminal-Bench 2.1 81.0, Pontuação do SWE-bench Pro 62.1, Pontuação do FrontierSWE 74.4, Pontuação do PostTrainBench 34.3, Pontuação do DeepSWE 46.2, Pontuação do MCP-Atlas 76.8 e Pontuação do AIME 2026 99.2 — sendo o Modelo de código aberto com a melhor classificação em três avaliações de longa duração. A tabela completa está acima.

Depende da tarefa. O GLM-5.2 lidera o GPT-5.5 em FrontierSWE, PostTrainBench e Terminal-Bench 2.1, e lidera o Gemini 3.1 Pro em quase todas as linhas de Programação, enquanto o Claude Opus 4.8 continua liderando em SWE-bench Pro, NL2Repo e SWE-Marathon. Sob o framework Claude Code, o GLM-5.2 obteve 82.7 pontos, e o Opus 4.8 obteve 78.9 pontos.

Eles controlam a quantidade de recursos de computação que o Modelo consome em cada tarefa. Na avaliação do Agente inteligente de Programação, os gráficos relatados são cerca de 63% (~35K tokens de saída, Não pensar), 72% (~43K, Alto) e 74% (~83K, Máximo). O Alto é a escolha prática padrão; Máximo é usado para problemas de longa duração realmente difíceis.

Sim. Os pesos do Modelo nuclear GLM são licenciados sob a licença MIT, sem restrições geográficas, e estão disponíveis em HuggingFace e ModelScope. Suporta raciocínio local através de transformers, vLLM, SGLang, xLLM e ktransformers, permitindo que você execute o Modelo GLM em sua própria hardware.

O IndexShare compartilha um LeveIndexador entre cada quatro camadas de atenção esparsa, cujo índice top-k é calculado uma vez e reused. Isso elimina o trabalho do Indexador em um quarto das camadas, reduzindo a FLOPs por token em 2.9 vezes sob uma extensão de contexto de 1 milhão — isso é a mudança crucial que permite que a janela de token de 1 milhão seja viável no nível de serviço.

Oferecido gratuitamente por meio do OpenRouter, um grande Modelo de Linguagem Open Source — não é o GLM-5.2 e não usa pesos GLM. Sua existência é para permitir que você teste Modelos em tempo real ao ler dados de Modelo GLM publicados. Todos os dados de referência GLM deste site são resultados reportados pelos autores do Modelo, não medições feitas aqui.

Experimente o modelo AI em tempo real gratuitamente — sem conta

Leia o Modelo GLMTeste de referência e, em seguida, deixe o Modelo real começar a trabalhar. A Cena de Experiência acima é gratuita e não requer nenhuma informação; se você quiser um pacote de ferramentas AI mais completo, o pacote gratuito dos parceiros começa aqui.