
Grok 4.6 vs Grok 4.5: benchmarks, coste y migración
xhigh, una caché más cara y las mejoras publicadas por el proveedor. La ruta y el precio actuales están en la página API de Grok 4.6.Comparativa rápida
| Factor | Grok 4.6 | Grok 4.5 | Implicación |
|---|---|---|---|
| ID | grok-4.6 | grok-4.5 | Mantener los ID en configuración. |
| Contexto | 500K | 500K | La capacidad no justifica por sí sola migrar. |
| Razonamiento | low, medium, high, xhigh | low, medium, high | Probar xhigh solo en tareas valiosas. |
| Precio estándar por 1M | 2 $ / 0,50 $ caché / 6 $ | 2 $ / 0,30 $ / 6 $ | Las cargas con mucha caché pueden favorecer 4.5. |
| Precio de contexto largo | 4 $ / 1 $ / 12 $ | 4 $ / 0,60 $ / 12 $ | La diferencia de caché sigue tras 200K. |
| Primera prueba | Código difícil, agentes, apps visuales | Cargas Grok estables | Migrar por carga, no por antigüedad. |
Qué ha cambiado realmente
xAI describe Grok 4.6 como reentrenado para tareas agénticas largas, repositorios desconocidos, estructuración, implementación y autopruebas. Son afirmaciones del proveedor que indican qué evaluar, no sustituyen las pruebas con tus herramientas.
Grok 4.5 sigue siendo una base estable. La pregunta es si 4.6 reduce suficientes fallos, reintentos, bucles de herramientas o correcciones humanas.
Cómo leer los benchmarks oficiales
xAI publica mejoras en CursorBench, DeepSWE, FrontierCode, Artificial Analysis y GDPVal, como 69,9 frente a 66,7 en CursorBench y 65,9 frente a 54,0 en DeepSWE. Son resultados atribuidos al proveedor, útiles para elegir pruebas pero no generalizables automáticamente.
| Pregunta | Interpretación segura | Siguiente paso |
|---|---|---|
| ¿4.6 gana en el informe? | Sí, en la comparativa publicada. | Reproducir la carga más parecida. |
| ¿Prueba menor coste? | No, faltan herramientas y reintentos propios. | Medir coste por tarea aceptada. |
| ¿Hay que retirar 4.5? | No, no todo el tráfico mejora. | Segmentar y hacer canary solo a ganadores. |
El coste no es idéntico
La entrada y salida directa coinciden, pero la caché cuesta 0,50 $ por millón en 4.6 y 0,30 $ en 4.5 por debajo de 200K. Compara los módulos de precio de EvoLink y el uso real.
accepted_task_cost = input + cached_input + output + tool_calls
+ retries + fallback_calls + reviewer_time¿Qué cargas deberían migrar primero?
| Carga | Inicio | Regla de promoción |
|---|---|---|
| Función en repositorio desconocido | Shadow test con 4.6 | Más cambios completos y tests superados |
| Agente largo con herramientas | Replay emparejado | Menos bucles e intervención |
| Frontend visual | Evaluación con 4.6 | Responsive, accesible y conforme al sistema |
| Chat o extracción estable | Mantener 4.5 al inicio | Cambiar solo si mejora calidad o coste total |
| Sesión con mucha caché | Comparar con mismo contexto | Incluir tarifa y tasa de aciertos |

Plan seguro de migración en EvoLink
- Mantener
grok-4.5como ruta de reversión. - Reproducir 20–50 tareas en
grok-4.6con el mismo contexto y herramientas. - Medir aceptación, latencia, tokens, herramientas, reintentos y revisión.
- Usar tráfico sombra antes de mostrar resultados.
- Hacer canary solo en las clases donde 4.6 gane.
- Revertir ante regresiones de identidad, fiabilidad, coste o calidad.
EvoLink reduce el trabajo de integración con un gateway único, pero cada modelo necesita pruebas de aceptación explícitas.
Preguntas frecuentes
¿Es Grok 4.6 mejor que Grok 4.5?
Los resultados publicados son superiores, pero deciden tus cargas, herramientas, latencia y coste por tarea aceptada.
¿Usan el mismo ID?
grok-4.6 y grok-4.5, respectivamente.¿Los precios son idénticos?
Entrada y salida estándar sí, entrada en caché no. Revisa el precio en vivo de EvoLink.
¿Ambos tienen contexto de 500K?
Sí. Las dos páginas oficiales documentan 500.000 tokens.
¿Debe migrar una aplicación de inmediato?
No. Empieza con replay, tráfico sombra y un canary pequeño con fallback probado.
¿Qué hay que medir?
Aceptación, latencia, tokens, éxito de herramientas, reintentos, corrección humana y coste por tarea aceptada.


