Modelos GLM - AI de 1 millón de tokens de contexto diseñada para tareas a largo plazo

GLM-5.2 es el modelo de IA GLM de código abierto de nivel insignia: con un contexto de 100,000 tokens estable, sin pensamiento / alto / el más alto en términos de fuerza de pensamiento, reporta una puntuación de 81.0 en Terminal-Bench 2.1 y 74.4 en FrontierSWE. A continuación, puede comparar cada modelo de GLM o primero experimente con el campo de experiencia gratuito de IA.

1M
Contexto de token
Mejora desde 200K, manteniéndose estable bajo carga de agente
81.0
Terminal-Bench 2.1
Puntuación de GLM-5.2, con un aumento de 63.5 en comparación con GLM-5.1
MIT
Licencia de código abierto
Peso abierto, sin restricciones geográficas

Sala de experiencia gratuita de AI — Experiencia en tiempo real de modelos de lenguaje de código abierto grandes

Sin registro necesario, sin cuenta, sin límites. Ingrese las palabras clave de entrada para obtener respuestas en modo de flujo.

La respuesta se mostrará aquí en forma de flujo...

Esta experiencia utiliza el modelo de gran lenguaje GLM, ingrese las palabras clave de entrada para obtener respuestas en tiempo real en modo de flujo.

Capacidades nucleares de la familia de modelos GLM

Cuatro capacidades definen la generación actual de modelos GLM, todas reportadas por los autores del modelo y reproducibles desde el acceso abierto.

Contexto de millón de palabras estable

El contexto de 100,000 tokens no solo está disponible, sino que también mantiene la calidad: GLM-5.2 se entrenó en trayectorias de inteligencia artificial de largo contexto en implementaciones a gran escala, investigación automatizada y depuración compleja.

Fuerza de pensamiento flexible

Los niveles de no pensamiento, alto y el más alto le permiten equilibrar entre retraso y capacidad según la tarea — en la evaluación de programación de inteligencia artificial, aproximadamente 63% (~35K tokens de salida) a 74% (~83K).

Arquitectura de IndexShare

Cada cuatro capas de atención esparsa comparten un indexador ligero, reduciendo 2.9 veces los FLOPs por token en un contexto de 1 millón de tokens, manteniendo la calidad a largo plazo sin pérdida.

Peso abierto de MIT

Modelo de código abierto GLM bajo licencia MIT: los pesos se publican en HuggingFace y ModelScope, sin restricciones geográficas, y se admite la implementación local a través de transformers, vLLM, SGLang, xLLM y ktransformers.

Resultados a largo plazo del benchmark de GLM 5.2

Todos los datos siguientes son resultados de GLM-5.2 y modelos comparativos publicados por los autores de los modelos. glmmodel.net solo realiza informes y no ejecuta estas evaluaciones.

Modelo de código abierto en primer lugar
74.4%

FrontierSWE

Duración de la tarea hasta 20 horas

GLM-5.274.4
Opus 4.875.1
GPT-5.572.6
Gemini 3.1 Pro39.6
Segundo en el ranking general
34.3%

PostTrainBench

Hasta 10 horas en una única H100

GLM-5.234.3
Opus 4.837.2
Opus 4.728.6
GPT-5.525.0
Sólo inferior a la serie Opus
13.0%

SWE-Marathon

Ingeniería de software de ciclo largo, hasta 10 horas

GLM-5.213.0
Opus 4.826.0
GPT-5.512.0
Gemini 3.1 Pro4.0

En tres evaluaciones de largo plazo, GLM-5.2 es el modelo de código abierto con la mejor posición — lo que demuestra que su capacidad de contexto de un millón de tokens se puede traducir en producción real, no solo en una cantidad de tokens aceptable. En FrontierSWE solo está un punto por detrás de Opus 4.8, un punto por delante de GPT-5.5 y once puntos por delante de la generación anterior Opus 4.7.

Terminal-Bench 2.1+17.5
GLM-5.281.0
Opus 4.885.0
GLM-5.163.5
SWE-bench Pro+3.7
GLM-5.262.1
Opus 4.869.2
GLM-5.158.4
NL2Repo+6.2
GLM-5.248.9
Opus 4.869.7
GLM-5.142.7
DeepSWE+28.2 (2.6×)
GLM-5.246.2
GPT-5.570.0
GLM-5.118.0
ProgramBench+12.8
GLM-5.263.7
Opus 4.871.9
GLM-5.150.9
MCP-Atlas+5.0
GLM-5.276.8
Opus 4.877.8
GLM-5.171.8
Tool-Decathlon+7.5
GLM-5.248.2
Opus 4.859.9
GLM-5.140.7
HLE+9.5
GLM-5.240.5
Opus 4.849.8
GLM-5.131.0

Puntuaciones del modelo GLM en 17 pruebas de referencia

Resultados de referencia publicados de modelos GLM, que cubren 17 evaluaciones de 8 modelos.

Resultados de referencia del modelo GLM publicado, que incluye cada evaluación y modelo.
Pruebas de referenciaGLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
Razón
HLE40.531.041.437.037.749.8*41.4*45.0
HLE (con herramientas)54.752.353.548.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.094.695.798.398.2
HMMT 2025 de noviembre94.494.095.084.494.496.596.594.8
HMMT Febrero 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.089.883.581.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
Programación
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.947.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (mejor marco)82.7 (Claude Code)69.0 (Claude Code)78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE Dominance74.430.529.075.172.639.6
PostTrainBench34.320.137.228.421.6
SWE-Marathon13.01.026.012.04.0
Agente inteligente
MCP-Atlas (conjunto público)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.752.859.955.648.8

* Puntuación en conjuntos de datos completos.

Intensidad de reflexión: sin reflexión, alta y máxima

Los modelos GLM no tienen solo una velocidad. El control de intensidad de pensamiento le permite asignar más recursos de cálculo solo cuando es necesario.

No reflexionar

~63%

~35K token promedio

Escenarios donde la edición rápida, el código de plantilla, la refactorización convencional y otros son más importantes que la latencia de profundidad.

Más utilizado

Alto

~72%

~43K token promedio

Elección predeterminada para la mayoría de los programas de inteligencia artificial: calidad cercana a la más alta con aproximadamente la mitad del consumo de tokens.

Máximo

~74%

~83K token promedio

Problemas a largo plazo difíciles: asignar recursos de cálculo adicionales solo cuando sea necesario para la tarea.

Los datos provienen del promedio de Terminal-Bench 2.1, DeepSWE y SWE-Atlas QnA, evaluados en Claude Code 2.1.167. Informado por el autor del modelo. En un presupuesto de tokens similar, el rendimiento de GLM-5.2 está entre Claude Opus 4.7 y Opus 4.8.

¿Cómo implementa el modelo GLM un millón de contextos?

Elevar el límite de contexto desde 200K a 1 millón de tokens es un problema de ingeniería, no un parámetro de configuración. Tres cambios son cruciales.

Atención esparsa de IndexShare

Cada cuatro capas de Transformer comparten un índice ligero. Se encuentra en la primera de las cuatro capas, y su índice top-k se repite en las otras tres — eliminando el punto de intersección del índice y el cálculo top-k en un cuarto de las capas. Resultado: cada token reduce 2.9 veces los FLOPs en un contexto de un millón de tokens. IndexShare se introdujo desde la mitad del entrenamiento con una longitud de secuencia de 128K.

Compartición de capas del modelo GLM y IndexShare Capa N+3 Capa N+2 Capa N+1 Capa N Compartir Indexador

MTP junto con IndexShare y KVShare

Las capas de predicción de múltiples tokens ejecutan el índice una vez en la primera etapa de borrador y luego reutilizan el índice en las etapas posteriores, eliminando la incompatibilidad de cacheo de KV entre el entrenamiento y la inferencia de la generación anterior. Combinado con muestreo de rechazo y pérdida de TV de extremo a extremo, la longitud aceptada aumenta de 4.56 a 5.47 — aproximadamente un 20% — a través de 7 pasos de MTP.

Experimento de ablación de longitud de MTP
Base4.56
+ IndexShare + KVShare5.10
+ Rechazar muestreo5.29
+ Pérdida de TV de extremo a extremo5.47 (+20%)

Servicio eficiente para millones de contextos

Después de más de cien mil tokens, el cuello de botella ya no es la computación, sino la capacidad de cacheo de KV, el núcleo de contexto largo y los costos de CPU. Tres reparaciones: gestión de memoria de nivel fino y paralelización basada en LayerSplit, optimización del núcleo de escalado de longitud del contexto coordinado con el tubo de transferencia de cacheo, y optimización de gestión de cacheo, programación de solicitudes y ajustes de rutas en tiempo de ejecución en el lado de CPU. La ventaja de capacidad aumenta con el crecimiento del contexto.

Ventaja de capacidad de salida normalizada

Entrenamiento de aprendizaje reforzado de agentes

El stack de entrenamiento (slime) combina rollout de caja blanca y caja negra, trayectorias compactas y flujos de trabajo de subagentes. El entrenamiento paralelo de OPD combina docenas de modelos expertos en aproximadamente dos días, y el cacheo de KV en FP8 asegura que el rollout no supere el presupuesto de memoria.

Hackers de recompensa inversa

El RL a largo plazo puede generar atajos, por lo que las acciones sospechosas se pasan primero a través de un filtro de recuperación basado en reglas, y luego se someten a una revisión de precisión exacta por parte de un LLM. Las actividades de hacking confirmadas se interceptan en línea y se responden con resultados de herramientas virtuales, permitiendo que el rollout continúe en lugar de ser descartado. El PPO basado en Critic mantiene la entrenabilidad de las subrutas compactas en un solo rollout.

Escenarios en los que el modelo GLM brilla en ciclos largos

Implementación a gran escala

Funcionalidad de múltiples archivos que supera la ventana de contexto única: el modelo mantiene el estado del repositorio completo en la vista, en lugar de volver a leerlo en cada pocos rounds.

Investigación automatizada

Ciclos de experimentación de varias horas, los agentes necesitan planificar, ejecutar, leer resultados y corregir — esto es exactamente la carga de trabajo que FrontierSWE y PostTrainBench diseñaron para evaluar.

Optimización de rendimiento

Se requiere un gráfico de llamadas completo, salida del analizador y un núcleo y sistema de trabajo que mantengan el mismo rastro en intentos previos.

Depuración compleja

Un seguimiento prolongado de la reproducción, pruebas inestables y fallos transversales de servicios, el truncamiento del contexto es la razón de la pérdida de bugs.

Todos estos escenarios se pueden ejecutar en su propio hardware — pesos de MIT, transformers · vLLM · SGLang · xLLM · ktransformers.¿Cómo ejecutar localmente el modelo GLM? →

Preguntas frecuentes sobre el modelo GLM

GLM es una familia de modelos de lenguaje grandes de peso abierto, con GLM-5.2 como el modelo insignia. La línea de productos va desde GLM-4.5-Air y GLM-4.7 hasta GLM-5, GLM-5-Turbo, GLM-5.1 y ahora GLM-5.2, incluyendo variantes de voz y visión. Cada modelo GLM fundamental se publica bajo la licencia MIT, con pesos completamente abiertos.

GLM-5.2 eleva el límite de 200K a un millón de tokens estables, con una salida de tokens máxima de 128K. "Estable" es la palabra clave: el modelo se entrenó en trayectorias de inteligencia artificial de largo código, por lo que la calidad se mantiene constante en todo el contexto, en lugar de degradarse a medida que la ejecución se vuelve más compleja.

Los resultados publicados incluyen una puntuación de Terminal-Bench 2.1 de 81.0, SWE-bench Pro de 62.1, FrontierSWE de 74.4, PostTrainBench de 34.3, DeepSWE de 46.2, MCP-Atlas de 76.8 y AIME 2026 de 99.2 — siendo el modelo de código abierto con la mejor posición en tres evaluaciones de largo plazo. Ver la tabla completa arriba.

Depende del tipo de tarea. GLM-5.2 lidera en FrontierSWE, PostTrainBench y Terminal-Bench 2.1 sobre GPT-5.5, y en la mayoría de las líneas de código sobre Gemini 3.1 Pro, mientras que Claude Opus 4.8 sigue liderando en SWE-bench Pro, NL2Repo y SWE-Marathon. Bajo el marco Claude Code, GLM-5.2 obtiene 82.7 puntos, y Opus 4.8 78.9.

Controlan cuántos recursos de cálculo consume el modelo en cada tarea. En la evaluación de programación de inteligencia artificial, los gráficos reportados son aproximadamente 63% (~35K tokens de salida, sin pensamiento), 72% (~43K, alto) y 74% (~83K, el más alto). El alto es la opción útil por defecto; el más alto se utiliza para problemas de largo plazo realmente difíciles.

Sí. Los pesos del modelo GLM fundamental se utilizan bajo la licencia MIT, sin restricciones geográficas, y se publican en HuggingFace y ModelScope. Soporta inferencias locales a través de transformers, vLLM, SGLang, xLLM y ktransformers, y puede ejecutar modelos GLM en su propia hardware.

IndexShare permite que cuatro capas de atención dispersa compartan un índice ligero, y su índice top-k se calcula una vez y se repite. Esto elimina el trabajo del índice en un cuarto de las capas, reduciendo 2.9 veces los FLOPs por token en un contexto de un millón de tokens — lo que es una mejora clave para que la ventana de un millón de tokens sea viable en el nivel de servicio.

Ofrecemos un modelo de lenguaje grande de código abierto gratuito proporcionado por OpenRouter — no es GLM-5.2 y no utiliza pesos de GLM. Su existencia es para que pueda probar modelos en tiempo real mientras lee los datos de modelos GLM publicados. Todos los datos de referencia de GLM en este sitio son informados por los autores de los modelos, no por mediciones aquí.

Experiencia gratuita en tiempo real del modelo AI — Sin necesidad de cuenta

Lea las pruebas de referencia del modelo GLM y luego deje que el modelo real comience a trabajar. El campo de experiencia aquí es gratuito y sin necesidad de información alguna; si desea un paquete de herramientas de IA más completo, los paquetes gratuitos de los socios comienzan aquí.