GLM-5.2 API
$1.000(~ 68 credits) por 1M tokens de entrada; $3.500(~ 238 credits) por 1M tokens de salida
$0.250(~ 17 credits) por 1M tokens de lectura de caché
OpenAI-compatible endpoint. Supports thinking, tool calling, and prompt caching (cache reads only); cached input storage is free during a limited-time promo. Flat rate across the full ~1M context.
Acceso gestionado estable para cargas de trabajo de producción. Recomendado cuando necesitas facturación en el panel, control de claves API y un comportamiento de integración predecible.
Todas las versiones usan el mismo endpoint API. Solo cambia el parámetro model.
GLM-5.2 API
Enrute Z.ai GLM-5.2 a través de EvoLink para coding agents, uso agéntico de herramientas, Q&A de repositorios y análisis de contexto largo con una ventana de contexto de ~1M, deep thinking y prompt caching. Conéctese mediante un endpoint compatible con OpenAI, con precios desde $1.00/1M tokens de entrada.
Acceso y encaje del flujo
Ideal para
Agentes de código
Model ID
glm-5.2
Acceso
OpenAI-compatible
Contexto
Ventana 1M
Input
$1.00/1M
Integrado
Thinking + tools + caché

¿Qué puedes construir con la API GLM-5.2?
Coding Agents y herramientas para desarrolladores
Construya copilots de codificación y agentes que manejen Q&A de repositorios, generación de código y revisión. Como GLM-5.2 habla la API Chat Completions de OpenAI, se integra en extensiones de editor, CLIs de codificación y frameworks de agentes que ya admiten endpoints compatibles con OpenAI, mientras que el deep thinking maneja el razonamiento multi-paso en una sola API.

Uso agéntico de herramientas y function calling
Impulse agentes autónomos que llaman herramientas, consultan APIs y orquestan flujos de trabajo multi-paso. El function calling y el deep thinking de GLM-5.2 le permiten planificar, invocar herramientas y reaccionar a los resultados, para que pueda construir agentes de investigación, pipelines de datos y automatización de tareas en un solo endpoint.

Procesamiento de documentos y repositorios de contexto largo
Procese contratos, informes, bases de código y grandes bases de conocimiento sin fragmentación agresiva. La ventana de contexto de ~1M es ideal para resúmenes estructurados, pipelines de extracción y análisis de repositorios completos, mientras que el prompt caching mantiene asequibles los prefijos largos repetidos.

Por qué los equipos eligen la API GLM-5.2
Los equipos eligen GLM-5.2 en EvoLink cuando necesitan razonamiento sólido de codificación y agéntico, contexto largo, acceso compatible con OpenAI y precios de tokens predecibles sin construir una integración específica de proveedor.
Acceso compatible con OpenAI
Llame a GLM-5.2 a través de un endpoint `/v1/chat/completions` compatible con OpenAI con una sola clave EvoLink. El código y las herramientas existentes del SDK de OpenAI funcionan sin reconstruir su ruta de integración — solo cambie la URL base y el nombre del modelo.
Costo de producción predecible
Los precios de tokens visibles facilitan la presupuestación: entrada desde $1.00/1M, salida desde $3.50/1M y lecturas de caché desde alrededor de $0.25/1M para prompts repetidos. El precio es una tarifa plana en todo el contexto de ~1M sin recargo por contexto largo, y el almacenamiento de entrada en caché es gratuito durante una promoción por tiempo limitado.
Thinking, herramientas y caching
Use ~1M de contexto para prompts grandes, active el deep thinking para razonamiento complejo, llame herramientas con function calling estructurado y confíe en el prompt caching para reducir el costo del contexto repetido.
Seguimiento del lanzamiento
¿Planificando GLM 5.5?
Sigue los hechos confirmados del lanzamiento, la disponibilidad de la API de EvoLink y las verificaciones de migración antes de reemplazar GLM-5.2.
Comparación de modelos
GLM-5.2 vs GPT-5.5 vs Claude Opus 4.8
Use estos tres modelos como shortlist para coding agents. Compare repo Q&A, refactors multiarchivo, PR review y trazas de tool calling con las mismas tareas.
| Modelo | Mejor para | Prueba contra GLM-5.2 | Rol de ruta |
|---|---|---|---|
| GLM-5.2 | Coding agents compatibles con OpenAI, repos con contexto 1M y tareas de ingeniería sensibles al coste. | Repo Q&A completo, retención de contexto largo, bucles de herramientas, prompt caching y coste por tarea exitosa. | Candidato a ruta por defecto o ruta eficiente en coste para coding agents. |
| GPT-5.5 | Razonamiento y coding flagship de OpenAI con fuerte encaje de SDK y ecosistema de herramientas. | Debugging difícil, revisión de arquitectura, workflows GPT existentes y escaladas premium. | Benchmark GPT premium o ruta de escalado. |
| Claude Opus 4.8 | Razonamiento complejo, long-horizon agentic coding y trabajo de ingeniería de alta autonomía. | Refactors multiarchivo, calidad de PR review, recuperación en tool use y sesiones largas de agente. | Benchmark Claude premium para las trazas de coding-agent más difíciles. |
La página de producto no debe declarar un ganador universal. La decisión útil es qué ruta gana en sus propias trazas de ingeniería.
Leer la guía completaCómo integrar la API GLM-5.2
Mantenga su cliente compatible con OpenAI existente, apúntelo a EvoLink, establezca el modelo en glm-5.2 y use la misma ruta para flujos de trabajo de coding-agent, agénticos y de contexto largo.

Paso 1 — Autenticación
Cree una clave API de EvoLink y establezca la URL base de EvoLink. Use autenticación Bearer con el endpoint compatible con OpenAI.
Paso 2 — Establecer campos requeridos
Envíe `model: glm-5.2` con su array `messages`. Reutilice prompts de sistema y prefijos estables para beneficiarse del prompt caching en cargas de trabajo repetidas.
Paso 3 — Ajustar salidas
Ajuste temperature, top_p, max_tokens y stream como de costumbre. Pase `tools` para function calling. Nota: el thinking está activado de forma predeterminada y aumenta los tokens de salida — establezca `thinking` en deshabilitado para reducir el costo cuando no necesite razonamiento profundo.
Características de la API GLM-5.2 para equipos de producción
Controles concretos y señales de despliegue en lugar de una descripción genérica del modelo
Modo deep thinking
Active el thinking para matemáticas, lógica y análisis complejo multi-paso. El razonamiento se expone como un campo o bloque de contenido separado, para que pueda mostrar u ocultar la cadena de pensamiento en su producto. Está activado de forma predeterminada y se puede deshabilitar por solicitud.
Ventana de contexto de ~1M
Ajuste bases de código completas, documentos largos y contexto multi-turno en una sola solicitud antes de recurrir a fragmentación agresiva u orquestación multi-paso.
Tool calling y function calling
Defina herramientas y deje que GLM-5.2 las planifique e invoque con argumentos estructurados, habilitando agentes autónomos, orquestación de APIs y automatización de tareas.
API compatible con OpenAI
Conéctese con el SDK de OpenAI mediante `/v1/chat/completions` cambiando la URL base y el nombre del modelo — sin reconstruir la integración.
Prompt Caching
Los prefijos repetidos y prompts de sistema se facturan a una tarifa de lectura de caché más baja, lo que ayuda a los flujos de trabajo de agentes recurrentes y al tráfico de producción de alto volumen. El almacenamiento de entrada en caché es gratuito durante una promoción por tiempo limitado.
Precios de tokens planos
GLM-5.2 usa una única tarifa plana en toda su ventana de contexto de ~1M, sin recargo por contexto largo, por lo que el costo escala de manera predecible con el tamaño del prompt.
Preguntas frecuentes sobre la API GLM-5.2
Everything you need to know about the product and billing.