O GLM-5.2 é um Modelo de IA GLM de código aberto de nível Flagship: com 1 milhão de Contexto de token estável, três níveis de Força de pensamento (Não pensar / Alto / Máximo), e obteve uma pontuação de 81.0 no Terminal-Bench 2.1 e 74.4 no FrontierSWE. Abaixo, você pode Comparar cada Modelo GLM — ou experimentar gratuitamente a Cena de experiência AI.
Sem registro, sem conta, sem limite. Insira palavras-chave de entrada para obter respostas em fluxo.
A resposta será transmitida em streaming aqui...
Esta experiência utiliza o modelo de grande linguagem GLM, insira palavras-chave de entrada para obter respostas em tempo real.
Quatro capacidades definem a geração atual de modelos GLM — todas relatadas pelos autores do modelo e reproduzíveis a partir de direitos abertos.
O contexto de token não só é disponível, mas mantém qualidade: o GLM-5.2 foi treinado na trilha do Agente Inteligente de Codificação de Longo Contexto, incluindo Implementação em Escala Ampla, Pesquisa Automatizada e Depuração Complexa.
Não pensar、Alto和Máximo三档让您按任务在延迟与能力之间权衡 — 在Agente inteligenteProgramação评估上,约 63%(~35K 输出 token)到 74%(~83K)。
Cada quatro camadas de atenção esparsa compartilham um indexador leve, reduzindo os FLOPs de cada token em 2,9 vezes sob uma extensão de contexto de 1 milhão de tokens, mantendo a qualidade de longo alcance inalterada.
Modelo GLM Open Source sob licença MIT: pesos publicados em HuggingFace e ModelScope, sem restrições geográficas, suportando implantação local via transformers, vLLM, SGLang, xLLM e ktransformers.
Todos os dados a seguir são resultados de modelos GLM-5.2 e comparativos publicados pelos autores dos modelos. glmmodel.net apenas realiza relatórios, não executando essas avaliações.
Tempo de tarefa até 20 horas
Até 10 horas em uma única H100
Engenharia de software de longo prazo, até 10 horas
No teste de referência de longa duração de três itens, o GLM-5.2 é o Modelo de código aberto com a melhor classificação — provando que seu milhão de contexto pode ser convertido em produção real, e não apenas em um número aceitável de tokens. No FrontierSWE, ficou apenas um ponto atrás do Opus 4.8, um ponto à frente do GPT-5.5 e onze pontos à frente do Opus 4.7 da geração anterior.
Resultados de benchmark publicados para modelos GLM, cobrindo 17 avaliações de 8 modelos.
| Teste de referência | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Raciocínio | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE (com ferramentas) | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT 2025 de novembro | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Fevereiro de 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Programação | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (melhor framework) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agente inteligente | ||||||||
| MCP-Atlas (conjunto público) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* Pontuação para o conjunto de dados completo.
Os modelos GLM não têm apenas uma velocidade. O controle de força de pensamento permite que você distribua mais recursos de computação apenas quando necessário.
~35K token médio
Edição rápida, código de modelo, refatoração convencional e outras situações onde a latência é mais importante do que a profundidade.
~43K token médio
Escolha padrão para a programação de agentes inteligentes: com cerca de metade do consumo de tokens, se aproxima da qualidade de topo.
~83K token médio
Problemas de longo prazo difíceis — distribua recursos de computação adicionais apenas quando necessário para a tarefa.
Os dados são a média do Terminal-Bench 2.1, DeepSWE e SWE-Atlas QnA, avaliados no Claude Code 2.1.167. Relatados pelo autor do Modelo. Com um orçamento de token semelhante, o desempenho do GLM-5.2 está entre o Claude Opus 4.7 e o Opus 4.8.
Aumentar o limite de contexto de 200K para 1 milhão de tokens é um problema de engenharia, não um parâmetro de configuração. Três mudanças são cruciais.
Cada quatro camadas do Transformer compartilham um LeveIndexador. Ele está localizado na primeira camada entre as quatro, e seu índice top-k é reused pelos outros três níveis — eliminando o ponto de Indexador e o cálculo top-k em um quarto das camadas. Resultado: cada token reduz a FLOPs em 2.9 vezes sob uma extensão de contexto de 1 milhão. O IndexShare foi introduzido a partir do meio do treinamento com uma extensão de sequência de 128K.
A camada de predição de múltiplos token executa uma vez o Indexador no primeiro passo do rascunho e reutiliza o índice nos passos subsequentes, eliminando a incompatibilidade de cache KV de treinamento/Raciocínio da geração anterior. Com a combinação de amostragem rejeitada e perda TV de extremo a extremo, a aceitação de comprimento aumenta de 4.56 para 5.47 — cerca de 20% — ao longo de 7 passos MTP.
| Baseline | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Recusa de amostragem | 5.29 |
| + Perda de TV de extremo a extremo | 5.47 (+20%) |
Depois de mais de alguns milhões de token, o gargalo não é mais a computação, mas a capacidade de cache KV, o núcleo de contexto longo e o consumo de CPU. Três correções: gerenciamento de memória de alta granularidade e paralelização baseados em LayerSplit, otimização do núcleo de escalonamento de comprimento de contexto em coordenação com o pipeline de transmissão de cache, e otimização de gerenciamento de cache, agendamento de solicitações e ajustes de caminho de execução do lado de CPU. A vantagem de capacidade de processamento aumenta à medida que o contexto cresce.
Vantagem de taxa de escoamento normalizada
训练栈(slime)结合白盒和黑盒 rollout、紧凑轨迹和子Agente inteligente工作流。并行 OPD 训练在大约两天内合并了十余个专家Modelo,FP8 KV 缓存确保 rollout 内存不超预算。
O RL de longo prazo pode gerar atalhos, portanto, ações suspeitas são primeiramente filtradas por um filtro de recall baseado em regras, seguidas por uma verificação de precisão do juiz LLM. Ações de hacker confirmadas são interceptadas online e respondidas com resultados de ferramentas virtuais, permitindo que o rollout continue em vez de ser descartado. O PPO baseado em Critic mantém a treinabilidade das sub-trilhas compactadas em um único rollout.
Do nível Flash de 30B ao porta-aviões de contexto de 1 milhão de tokens — escolha um modelo GLM e veja a tabela de especificações completa e os dados de referência.
Contexto de 1 milhão de tokens, SOTA (State-of-the-Art) aberto para tarefas de programação e longos períodos, com maior capacidade de engenharia de agente inteligente.
Geração anterior de porta-aviões: capacidade de longo prazo significativamente melhorada e saída de engenharia de nível de horas de trabalho autônomo.
Capacidade de programação mais forte, execução de múltiplos passos mais confiável e comportamento de agente inteligente mais complexo.
Modelo básico, otimizado para cenários de longa cadeia e agentes inteligentes dinâmicos.
Capacidade de programação aprimorada, inferência estável em múltiplos passos e geração de frontend melhorada.
300 milhões de parâmetros; alta eficiência e desempenho, à frente dos modelos open-source da mesma escala.
Modelo GLM de pequeno volume, desempenho unitário de capacidade de cálculo excelente.
Reconhecimento de voz em tempo real para texto, CER até 0.0717.
Função de múltiplos arquivos que ultrapassa a janela de contexto única: o modelo mantém o estado do repositório inteiro na visão, em vez de ler novamente a cada algumas rodadas.
数小时的实验循环,Agente inteligente需要规划、运行、读取结果和修正 — 这正是 FrontierSWE 和 PostTrainBench 设计来评估的工作负载。
Necessário para um gráfico de chamadas completo, saída do analisador e tentativas anteriores para manter o núcleo e o trabalho do sistema na mesma trajectória.
Uma longa rastreamento de reprodução, testes instáveis e falhas transversais de serviço, a truncagem do contexto é a razão pela qual o Bug foi perdido.
以上所有场景均可在您自己的硬件上运行 — MIT 权重,transformers · vLLM · SGLang · xLLM · ktransformers。Como executar localmente o modelo GLM →
Leia o Modelo GLMTeste de referência e, em seguida, deixe o Modelo real começar a trabalhar. A Cena de Experiência acima é gratuita e não requer nenhuma informação; se você quiser um pacote de ferramentas AI mais completo, o pacote gratuito dos parceiros começa aqui.