GLM-Modelle - Open-Source AI für Millionen Kontexttoken, entwickelt für lange Zeiträume

GLM-5.2 ist die Flaggschiff-Open-Source-GLM-AI-Modelle: Stabile eine Million Token-Kontexte, nicht nachdenklich / hoch / höchste drei Stufen der Nachdenklichkeit, meldet auf Terminal-Bench 2.1 81.0 Punkte, auf FrontierSWE 74.4 Punkte. Unten können Sie jede GLM-Modelle vergleichen – oder erstmalig ein kostenfreies AI-Erlebnis nutzen.

1M
Token-Kontext
Von 200K aufgestiegen, stabil unter Agentenlast
81.0
Terminal-Bench 2.1
GLM-5.2-Scores haben sich im Vergleich zu GLM-5.1 um 63,5 verbessert.
MIT
Open-Source-Lizenz
Offene Gewichte, keine regionalen Beschränkungen

Kostenlose AI-Experience-Session - Erleben Sie den Echtzeit-Open-Source-grossen Sprachmodell

Keine Registrierung erforderlich, kein Konto, kein Limit. Geben Sie den Eingabetext ein, um eine Stream-Antwort zu erhalten.

Die Antwort wird hier als Stream ausgegeben...

Diese Demo verwendet den großen Sprachmodell GLM und bietet eine Echtzeit-Stream-Antwort, indem Sie den Eingabetext eingeben.

Core capabilities of the GLM model family

Vier Fähigkeiten definieren die aktuelle Generation von GLM-Modellen - alle von den Modellautoren berichtet und aus der Öffentlichkeit nachvollziehbar.

Stabile Millionen-Kontexte

Eine Million Token-Kontexte sind nicht nur verfügbar, sondern auch von hoher Qualität: GLM-5.2 wurde auf großen Implementierungen, Automatisierungsstudien und komplexen Debugging in langen Kontext- Agenten-Tracken trainiert.

Flexibler Denkumfang

Nicht nachdenklich, hoch und höchst drei Stufen lassen Sie zwischen Verzögerung und Fähigkeit abwägen – in der Agenten-Programmierungsevaluation etwa 63% (~35K Ausgabetoken) bis 74% (~83K).

IndexShare Architecture

Jede vier Sparse Attention-Schicht teilt einen leichten Indexer, was die FLOPs pro Token um das 2,9-fache reduziert und die Qualität über lange Distanzen erhalten bleibt, wenn die Kontextlänge auf eine Million Token erhöht wird.

MIT Open Source Gewichte

Open-Source-GLM-Modelle unter der MIT-Lizenz: Gewichte veröffentlicht auf HuggingFace und ModelScope, ohne geografische Beschränkungen, unterstützen lokale Deployment durch transformers, vLLM, SGLang, xLLM und ktransformers.

GLM 5.2 Benchmark-Test: Ergebnisse für lange Zeiträume

Alle folgenden Daten sind Ergebnisse von GLM-5.2 und Vergleichsmodellen, die von den Modellautoren veröffentlicht wurden. glmmodel.net führt nur Berichte durch und führt diese Bewertungen nicht selbst durch.

Erster Open-Source-Modell
74.4%

FrontierSWE

Task duration up to 20 hours

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
Gesamt第二名
34.3%

PostTrainBench

Up to 10 hours on a single H100

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
Nur unter der Opus-Serie
13.0%

SWE-Marathon

Ultra-long cycle software engineering, up to 10 hours

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

In allen drei langfristigen Benchmark-Tests ist GLM-5.2 das führende Open-Source-Modell – was zeigt, dass seine Millionen Kontexte in tatsächliche Ergebnisse umgesetzt werden können, und nicht nur akzeptable Token-Zahlen. Auf FrontierSWE liegt GLM-5.2 nur einen Punkt hinter Opus 4.8 zurück, einen Punkt vor GPT-5.5 und elf Punkte vor der vorherigen Generation Opus 4.7.

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

GLM-Modell Ergebnisse in 17 Benchmark-Tests

Veröffentlichte Benchmark-Ergebnisse von GLM-Modellen, die 17 Bewertungen für 8 Modelle umfassen.

Veröffentlichte Benchmark-Ergebnisse des GLM-Modells, einschließlich jeder Bewertung und des Modells selbst.
BasisprüfungenGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Deduktion
HLE40.531.041.437.037.749.8*41.4*45.0
HLE (mit Werkzeugen)54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT November 202594.494.095.084.494.496.596.594.8
HMMT Februar 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Programmieren
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (Beste Frameworks)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Intelligenzagent
MCP-Atlas (Public Dataset)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* Scores on the complete dataset.

Strength of thought: non-thinking, high, and highest

GLM-Modelle haben nicht nur eine Geschwindigkeit. Die Kraftkontrolle ermöglicht es Ihnen, nur dann mehr Rechenressourcen zu分配, wenn es notwendig ist.

Nicht nachdenklich

~63%

~35K average token

Schnelle Bearbeitung, Mustercode, allgemeine Refaktorierung und andere Szenarien, in denen Verzögerung wichtiger ist als Tiefe.

Am häufigsten verwendet

hoch

~72%

~43K average token

Standardwahl für die meisten Agenten-Programmierung: Mit etwa der Hälfte der Tokenverbrauch nahe der höchsten Qualität.

Höchst

~74%

~83K average token

Schwere langfristige Probleme - zusätzliche Rechenressourcen nur dann zuweisen, wenn der Task tatsächlich erforderlich ist.

Die Daten stammen aus dem Durchschnitt von Terminal-Bench 2.1, DeepSWE und SWE-Atlas QnA, bewertet auf Claude Code 2.1.167. Berichtet von den Modellautoren. Unter ähnlichen Token-Budgets liegt die Leistung von GLM-5.2 zwischen Claude Opus 4.7 und Opus 4.8.

How does the GLM model achieve a million contexts?

Die Erhöhung des Kontextlimits von 200K auf eine Million Tokens ist ein ingenieurtechnisches Problem und keine Konfigurationsparameter. Drei Änderungen sind entscheidend.

IndexShare Sparse Attention

Jede vier Transformer-Schicht teilt sich einen leichten Indexer. Er befindet sich in der ersten Schicht der vier und seine top-k-Indizes werden von den übrigen drei Schichten wiederverwendet – was den Indexer-Punktprodukt und die top-k-Berechnung in einem Viertel der Schichten eliminiert. Ergebnis: Jeder Token hat unter einer Million Kontextlänge um 2,9-mal weniger FLOPs. IndexShare wurde ab der Mitte des Trainings mit einer Sequenzlänge von 128K eingeführt.

GLM-Modell-Layer-Sharing und IndexShare Schicht N+3 Schicht N+2 Schicht N+1 Schicht N Geteilt Indizierer

MTP in Kombination mit IndexShare und KVShare

Die Multi-Token-Vorhersage-Schichten führen den Indexer in der ersten Schreibphase aus und wiederholen ihn in den folgenden Schritten, was die Anpassung des KV-Caches zwischen Training und Inferenz des Vorjahres eliminiert. In Kombination mit der Ablehnung von Sampling und End-to-End TV-Loss steigt die akzeptierte Länge von 4.56 auf 5.47 – etwa 20% – über 7 MTP-Schritte hinweg.

MTP Akzeptanzlänge-Absorptionsversuch
Referenzlinie4.56
+ IndexShare + KVShare5.10
+ Abweisung der Stichprobe5.29
+ End-to-End TV-Verlust5.47 (+20%)

Effiziente Dienstleistung für Millionen von Kontexten

Nach mehr als einigen hunderttausend Token wird das Bottleneck nicht mehr die Berechnung, sondern die KV-Cache-Kapazität, das lange Kontextkern und die CPU-Ausgaben. Drei Reparaturen: Feingranularer Speichermanagement und Parallelisierung basierend auf LayerSplit, Optimierung des Kontextlänge-Skalierungskerns, der mit dem Cache-Übertragungspipeline abgestimmt ist, sowie CPU-seitige Cache-Management, Anforderungsscheduling und Laufzeitpfad-Optimierung. Der Durchsatzvorteil wächst mit dem Kontext.

Normalisierte Durchsatzvorteile

Training des intelligenten Agents durch Verstärkungslernen

Der Trainingsstapel (slime) kombiniert White-Box- und Black-Box-Rollouts, komprimierte Spuren und Sub-Agenten-Workflows. Parallel OPD-Training kombiniert in etwa zwei Tagen mehr als ein Dutzend Expertenmodelle, FP8 KV-Cache stellt sicher, dass der Rollout-Speicher innerhalb des Budgets bleibt.

Anti-Belohnungshacker

Langfristige RL kann kürzliche Wege erzeugen, daher werden verdächtige Aktionen zunächst durch einen regelbasierten Recall-Filter geleitet und dann durch eine präzise Überprüfung der Genauigkeit durch LLM beurteilt. Bestätigte Hacker-Aktionen werden online abgefangen und mit virtuellen Tool-Ergebnissen beantwortet, so dass der Rollout fortgesetzt werden kann, anstatt abgebrochen zu werden. Critic-basierte PPO hält die Trainierbarkeit der komprimierten Subtrajectoren auf einem Rollout aufrecht.

Scenarios where long-cycle GLM models excel

Groß angelegte Implementierung

Überwinden Sie die Funktion mehrerer Dateien, die über einen einzigen Kontextfenster hinausgehen: Das Modell hält den gesamten Repository-Status im Auge, anstatt nach einigen Runden neu zu lesen.

Automatisierte Forschung

Stundenlange Experimentierzyklen, Agenten müssen planen, ausführen, Ergebnisse lesen und korrigieren – das ist genau das, was FrontierSWE und PostTrainBench entworfen wurden, um zu bewerten.

Leistungsoptimierung

Benötigt eine vollständige Aufrufgraphik, Analyserausgaben und das Halten der Kerne und Systeme auf derselben Spur in vorherigen Versuchen.

Komplexe Fehlerbehebung

Lange Nachverfolgung von Wiederherstellungen, instabile Tests und Querschnittsfehler - das Kürzen des Kontexts ist der Grund für den Verlust von Bugs.

Alle diese Szenarien können auf Ihrer eigenen Hardware ausgeführt werden – MIT-Gewichte, transformers · vLLM · SGLang · xLLM · ktransformers.How to run the GLM model locally →

Häufig gestellte Fragen zum GLM-Modell

GLM ist eine Familie offener Gewichte großer Sprachmodelle, das aktuelle Flaggschiff ist GLM-5.2. Die Produktlinie reicht von GLM-4.5-Air und GLM-4.7 bis zu GLM-5, GLM-5-Turbo, GLM-5.1 und jetzt GLM-5.2, einschließlich Sprach- und visuellen Varianten. Jedes Kern-GLM-Modell wird unter der MIT-Lizenz veröffentlicht, die Gewichte sind vollständig offen.

GLM-5.2 hebt das Limit von 200K auf eine stabile Million Token, maximal 128K Ausgabetoken. 'Stabil' ist der Schlüsselwort: Das Modell wurde auf langen Codier- Agenten-Tracken trainiert, daher bleibt die Qualität im gesamten Fenster konstant, nicht im Laufe der Zeit komplexer wird.

Veröffentlichte Ergebnisse umfassen Terminal-Bench 2.1 mit 81.0 Punkten, SWE-bench Pro mit 62.1 Punkten, FrontierSWE mit 74.4 Punkten, PostTrainBench mit 34.3 Punkten, DeepSWE mit 46.2 Punkten, MCP-Atlas mit 76.8 Punkten und AIME 2026 mit 99.2 Punkten – in allen drei langfristigen Bewertungsstudien der führenden Open-Source-Modelle. Komplette Tabelle oben.

Abhängig von der Aufgabe. GLM-5.2 führt auf FrontierSWE, PostTrainBench und Terminal-Bench 2.1 GPT-5.5 vor, führt auf fast allen Programmierzeilen Gemini 3.1 Pro vor, und Claude Opus 4.8 bleibt auf SWE-bench Pro, NL2Repo und SWE-Marathon führend. Unter dem Claude Code-Framework erreichte GLM-5.2 82.7 Punkte, Opus 4.8 erreichte 78.9 Punkte.

Sie bestimmen, wie viel Rechenleistung der Modell für jede Aufgabe verbraucht. In der Agenten-Programmierungsevaluation betragen die Kurven etwa 63% (~35K Ausgabetoken, nicht nachdenklich), 72% (~43K, hoch) und 74% (~83K, höchst). Hoch ist die praktische Standardauswahl; Höchst für wirklich schwierige langfristige Probleme.

Ja. Die Gewichte der Kern-GLM-Modelle werden unter der MIT-Lizenz verwendet, ohne geografische Beschränkungen, und sind auf HuggingFace und ModelScope veröffentlicht. Unterstützung für lokale Inferenz durch transformers, vLLM, SGLang, xLLM und ktransformers, Sie können GLM-Modelle auf Ihrer eigenen Hardware ausführen.

IndexShare teilt einen leichten Indexer für jede vier Sparse Attention-Schicht, dessen top-k-Indizes nur einmal berechnet und dann wiederverwendet werden. Dies eliminiert die Arbeit des Indexers in einem Viertel der Schichten und reduziert die FLOPs pro Token unter einer Million Kontexten um 2,9-mal – dies ist der entscheidende Änderung, der es ermöglicht, Millionen Token-Fenster auf Service-Ebene durchzuführen.

Durch OpenRouter bereitgestellte kostenlose Open-Source-Modelle großer Sprachmodelle – nicht GLM-5.2, auch nicht mit GLM-Gewichten. Sein Bestehen ist, um Ihnen zu ermöglichen, die Daten der veröffentlichten GLM-Modelle sofort zu testen. Alle GLM-Benchmark-Daten auf dieser Seite sind Ergebnisse, die von den Modellautoren berichtet wurden, und nicht hier gemessen.

Kostenlose Echtzeit-AI-Modell-Erfahrung - Ohne Konto erforderlich

Lesen Sie die GLM-Modell-Benchmark-Tests und lassen Sie dann die echten Modelle arbeiten. Der Erfahrungsort oben ist kostenlos und erfordert keine Informationen; Wenn Sie ein vollständigeres AI-Toolset wünschen, beginnt der kostenlose Paket der Partner hier.