GLM-5.2 est un modèle d'IA GLM open source de niveau Flagship : 1 million de tokens de contexte stables, trois niveaux de force de réflexion (Non-Thinking / Haut / Highest), avec des scores rapportés de 81.0 sur Terminal-Bench 2.1 et 74.4 sur FrontierSWE. Vous pouvez comparer chaque modèle GLM ci-dessous - ou essayer gratuitement l'expérience AI Ground.
Pas besoin de s'inscrire, de créer un compte ou de demander des crédits. Entrez simplement un mot d'entrée pour obtenir des réponses en flux.
La réponse sera affichée en flux ici...
Cette expérience utilise le grand modèle de langage GLM, entrez simplement un mot d'entrée pour obtenir des réponses en flux en temps réel.
Quatre capacités définissent la génération actuelle des modèles GLM — toutes rapportées par les auteurs des modèles et ré replicables à partir de droits d'accès ouverts.
1 million de tokens de contexte non seulement est disponible, mais conserve également la qualité : GLM-5.2 a été formé sur des trajectoires d'agents de codage de contexte long, notamment dans l'Implémentation à grande échelle, la Recherche automatisée et le Débogage complexe.
Les niveaux Non-Thinking, Haut et Highest vous permettent de compromis entre délai et capacité pour les tâches - environ 63% (environ 35K tokens de sortie) à 74% (environ 83K) sur l'évaluation AgentProgramming.
Chaque quatrième couche d'attention rare partage un indexeur léger, ce qui réduit les FLOPs par token de 2,9 fois sous un contexte de 1 million de tokens, tout en préservant la qualité à long terme.
Modèle GLM open-source sous licence MIT : les poids sont publiés sur HuggingFace et ModelScope, sans restriction géographique, et supporte le déploiement local via transformers, vLLM, SGLang, xLLM et ktransformers.
Toutes les données ci-dessous sont les résultats de GLM-5.2 et des modèles comparatifs publiés par les auteurs des modèles. glmmodel.net ne réalise que des rapports et ne met pas en œuvre ces évaluations.
Durée de la tâche pouvant atteindre 20 heures
Jusqu'à 10 heures sur une seule carte H100
Ingénierie logicielle à long cycle, jusqu'à 10 heures
Dans les trois tests de base à long terme, GLM-5.2 est le modèle open source le mieux classé - prouvant que son million de tokens de contexte peut être converti en production réelle, et pas seulement en un nombre de tokens acceptable. Il est juste derrière Opus 4.8 de 1 point sur FrontierSWE, devant GPT-5.5 de 1 point et devant le précédent Opus 4.7 de 11 points.
Résultats de référence publiés pour les modèles GLM, couvrant 17 évaluations pour 8 modèles.
| Test de base | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Raisonnement | ||||||||
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE (avec outils) | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT novembre 2025 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT février 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | – | 89.8 | 83.5 | – | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| Programming | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (meilleur cadre) | 82.7 (Claude Code) | 69.0 (Claude Code) | – | – | – | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE Dominance | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agent | ||||||||
| MCP-Atlas (ensemble public) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
* Score sur l'ensemble des données complètes.
Les modèles GLM ne sont pas tous de la même vitesse. Le contrôle de la force de pensée vous permet de déployer plus de ressources de calcul uniquement lorsque cela est nécessaire.
~35K token moyen
Éditer rapidement, utiliser des modèles de code, des refactorings conventionnels et d'autres scénarios où la latence est plus importante que la profondeur.
~43K token moyen
Choix par défaut pour la programmation d'agents intelligents : avec environ la moitié de la consommation de tokens, la qualité approche le niveau le plus élevé.
~83K token moyen
Problèmes à long terme difficiles — allouer des ressources de calcul supplémentaires uniquement lorsque cela est nécessaire pour la tâche.
Les données proviennent de la moyenne des Terminal-Bench 2.1, DeepSWE et SWE-Atlas QnA, évaluées sur Claude Code 2.1.167. Rapportées par les auteurs du modèle. Sous un budget de tokens comparable, les performances de GLM-5.2 se situent entre Claude Opus 4.7 et Opus 4.8.
Augmenter la limite de contexte de 200K à 1 million de tokens est un problème d'ingénierie, pas un paramètre de configuration. Trois modifications sont cruciales.
Chaque quatre couches Transformer partagent un LightweightIndexer. Il est situé dans la première couche des quatre, et son index top-k est réutilisé par les trois autres couches - éliminant les produits scalaire et les calculs top-k dans trois quarts des couches. Résultat : chaque token voit une réduction de 2.9 fois les FLOPs à une longueur de contexte de 1 million. L'IndexShare a été introduit à partir de la longueur de séquence de 128K pendant la phase de formation.
Les couches de prédiction multi-token s'exécutent une seule fois l'Indexer au premier pas de brouillon et réutilisent l'index dans les étapes suivantes, éliminant ainsi le décalage entre le cache KV de formation/Raisonnement de la génération précédente. Combiné à la réduction de la probabilité de refus et à la perte TV de bout en bout, l'acceptation de la longueur passe de 4,56 à 5,47 — environ 20% — sur 7 étapes MTP.
| Baseline | 4.56 |
| + IndexShare + KVShare | 5.10 |
| + Refuser l'échantillonnage | 5.29 |
| + Pertes TV de bout en bout | 5.47 (+20%) |
Après plusieurs dizaines de milliers de tokens, le瓶颈n'est plus le calcul, mais la capacité de cache KV, le noyau de contexte long et la charge CPU. Trois corrections : gestion fine de la mémoire basée sur LayerSplit et parallélisation, optimisation du noyau de réduction de la longueur du contexte coordonnée avec le pipeline de transmission de cache, et optimisation de la gestion de cache côté CPU, de la planification des requêtes et de l'ajustement des chemins d'exécution en temps réel. L'avantage de la capacité de traitement augmente avec la croissance du contexte.
Avantage de la capacité de traitement normalisée
Le stack de formation (slime) combine des rollouts white-box et black-box, des trajectoires compactes et des flux de travail d'agents. La formation OPD en parallèle a intégré une douzaine de modèles experts en environ deux jours, et le cache FP8 KV assure que la mémoire de rollout ne dépasse pas le budget.
Les longs cycles de RL peuvent entraîner des raccourcis, donc les actions suspectes sont d'abord filtrées par un filtre de rappel basé sur des règles, puis vérifiées par l'exactitude du juge LLM. Les comportements d'hack confirmés sont interceptés en ligne et répondus par des outils virtuels, permettant ainsi de continuer le rollout plutôt que de l'abandonner. Le PPO basé sur le Critic conserve la trainabilité des sous-traces compressées sur un seul rollout.
De 30B au niveau Flash à un contexte de 1 million de tokens de pointe — choisissez un modèle GLM et consultez le tableau complet des spécifications et des données de référence.
1 million de tokens de contexte, SOTA ouvert pour les tâches de programmation et à long terme, avec une capacité d'ingénierie d'agent plus forte.
Génération précédente de pointe : une capacité à long terme considérablement améliorée et une production d'ingénierie de niveau professionnel pouvant fonctionner de manière autonome pendant plusieurs heures.
Une capacité de programmation plus forte, des exécutions à plusieurs étapes plus fiables et un comportement d'agent complexe amélioré.
Modèle de base, optimisé pour les scénarios de longues chaînes et d'agents intelligents dynamiques
Capacité de programmation améliorée, inférence multipas stable et génération frontend améliorée
300 milliards de paramètres ; haute performance et efficacité, en tête des modèles ouverts de la même taille.
Modèle GLM de petite taille, performance par unité de puissance remarquable
Reconnaissance vocale en temps réel vers texte, CER aussi bas que 0.0717
Fonctionnalité multi-fichiers au-delà d'une seule fenêtre de contexte : le modèle conserve l'état complet du dépôt à vue, plutôt que de lire à nouveau après quelques tours.
Des cycles d'expériences de plusieurs heures, l'agent doit planifier, exécuter, lire les résultats et corriger - c'est exactement le type de charge de travail que FrontierSWE et PostTrainBench sont conçus pour évaluer.
Besoin d'un graphique de appel complet, des sorties d'analyseurs et de tentatives précédentes pour rester sur la même trajectoire, tout en maintenant le noyau et le système en œuvre.
Un suivi de réplique long, des tests instables et des pannes transversales de service, la coupure du contexte est la raison pour laquelle les bugs sont perdus.
Tous ces scénarios peuvent être exécutés sur votre propre matériel - poids MIT, transformers · vLLM · SGLang · xLLM · ktransformers.Comment exécuter localement le modèle GLM →
Lisez le Modèle GLM de test de base, puis laissez le modèle réel commencer à travailler. Le terrain d'expérience en haut est gratuit et n'exige aucune information ; si vous souhaitez un kit d'outils AI plus complet, le forfait gratuit des partenaires commence ici.