GPT Image 2.5 Flare & Sunburst ya están disponibles en EvoLinkProbar GPT Image 2.5
Flujos de trabajo de cobre y cristal azul con bloques de memoria y un bucle de recuperación para Gemini 4 vs Claude Fable 5.1
analysis

Gemini 4 vs Claude Fable 5.1: agentes de larga duración

EvoLink Team
EvoLink Team
Equipo de producto
16 de septiembre de 2026
18 min de lectura
A 16 de septiembre de 2026, no hay ninguna ruta de Gemini 4 que añadir: manténgase en Claude Fable 5.1 y registre la referencia que una futura ruta de Gemini 4 tendrá que superar. A 16 de septiembre de 2026, no existe ninguna evidencia de ejecución de Gemini 4 que un equipo de agentes de larga duración pueda comparar con Claude Fable 5.1. Google ha confirmado únicamente que el preentrenamiento de Gemini 4 ha comenzado; no hay entrada pública en la API, ID de modelo, precio, cifra de contexto, regla de caché ni benchmark. Claude Fable 5.1 tiene un contrato publicado por Anthropic y una ruta configurada en EvoLink. Por tanto, la decisión para un Tech Lead o un responsable de FinOps no es "qué modelo debería ejecutar nuestros agentes", sino "qué deberíamos registrar en Fable 5.1 ahora para que una ruta de Gemini 4 tenga algo concreto que demostrar más adelante". Captura hoy tu referencia de tareas largas y reutilización de contexto, y después escribe las puertas que una ruta nueva debe superar antes de ganarse tráfico.
Este artículo se ocupa de una sola decisión: la elección para agentes de larga duración entre estos dos modelos. Las preguntas sobre la cronología del lanzamiento pertenecen al seguimiento del lanzamiento de Gemini 4; el estado actual de la API vive en la página de Gemini 4; el lado de OpenAI se cubre en Gemini 4 vs GPT-6 Astra; y los dos modelos frontera ya lanzados se comparan en Claude Fable 5.1 vs GPT-6 Astra, que ya contiene un ejemplo de caché con precios que este artículo no repite.

Tabla de estado y evidencias

PreguntaGemini 4Claude Fable 5.1Decisión segura
Estado oficialPreentrenamiento confirmado por Google (julio de 2026)Lanzado por Anthropic el 1 de septiembre de 2026; marcado como Active (latest)Trata la brecha como una brecha de estado, no como un veredicto de capacidad
ID de modelo de APINo publicadoclaude-fable-5-1 (Anthropic)Nunca pongas un ID no publicado en configuración ni en código
Contexto y salida máximaNo publicados1M de contexto; 128K de salida máxima (Anthropic)Registra cuánto de la ventana consumen realmente tus trazas
Modalidades de entradaNo publicadasEntrada de texto e imagen, salida de texto (Anthropic)Lista las modalidades que cada carga de trabajo requiere antes de probar
Controles de thinkingNo publicadosThinking adaptativo siempre activo; esfuerzo predeterminado high; latencia comparativa listada como Slower (Anthropic)Registra el ajuste de esfuerzo por traza para que una ruta posterior se pruebe con ajustes equivalentes
Estructura de precios de cachéNo publicadaEntrada $10 / salida $50 por MTok; escritura de caché de 5 minutos $12.50; escritura de caché de 1 hora $20; lectura de caché $0.25 por MTok (lista de Anthropic)La economía de la caché no puede compararse hasta que ambos lados publiquen TTL y tarifas
Disponibilidad de BatchNo publicadaAnthropic lista Batch con entrada y salida al 50 % del estándarCompara Standard con Standard, Batch con Batch
Cambios incompatibles documentadosNo publicadosTres en la guía de migración de Anthropic: errores con tool choice forzado, incompatibilidad de modelos anteriores con los thinking blocks de 5.1, thinking blocks invalidados tras editar turnos anterioresUna lista publicada de cambios incompatibles es comprobable; una ausente no lo es
Ruta de EvoLinkSin ruta invocable verificada; alerta de lanzamiento abiertaRuta configurada claude-fable-5-1; precio en la página de productoVerifica la identidad de modelo devuelta en la primera petición de cualquier ruta

La columna de Gemini 4 es una lista de lo que puede medirse, no una crítica. Cada celda "No publicado" es un campo para el que tu harness ya debería tener un hueco, de modo que un contrato publicado rellene valores en lugar de forzar un rediseño.

Qué tareas de larga duración merece la pena evaluar

El trabajo de agentes de larga duración no es una única carga de trabajo. Cinco clases de tarea cubren la mayoría de las trazas que los equipos enrutan a Fable 5.1, cada una con su propia definición de "aceptada". Registra la referencia por clase; juzga también por clase cualquier ruta futura de Gemini 4.

Carga de trabajoQué significa "aceptada"Qué registrar en Fable 5.1 ahoraQué debe igualar después una ruta de Gemini 4
Reparación de repositorios multiarchivoLos tests pasan, el diff se revisa, no se tocan archivos no relacionadosArchivos leídos y editados, tool calls, reintentos, minutos de revisor, tokens por corrección aceptadaMismo conjunto de tareas, suite de tests y rúbrica del revisor
Investigación multipaso y entregables de conocimientoLas citas resuelven, la estructura coincide con el brief, sin afirmaciones sin respaldoFuentes consultadas, revisiones solicitadas, correcciones factuales por entregableMismos briefs y misma pasada de verificación de hechos
Bucles de herramientas de varias horasEl bucle termina en la condición de parada con un estado final válidoNúmero de bucles, tool calls fallidas, checkpoints, eventos de reanudación, tiempo de reloj hasta la terminaciónMismas herramientas, permisos, presupuesto de reintentos y reglas de parada
Extracción estructurada sobre documentos largosLa salida valida contra el esquema; los campos muestreados coinciden con la fuenteLongitud del documento, fallos de esquema, reejecuciones, precisión de campos sobre una muestra fijaMismos documentos, esquema y muestra
Flujos multipaso de atención al cliente con herramientasTicket resuelto dentro de la política sin escalado humanoEscalados, llamadas a herramienta incorrecta, violaciones de política, tiempo de gestiónMismas definiciones de flujo y comprobaciones de política

Ninguna fila nombra un modelo preferido, porque no existe ninguna ejecución equivalente. La tabla solo fija qué significará "la misma tarea" cuando una segunda ruta esté disponible.

Reutilización de contexto y condiciones de caché

Los agentes de larga duración reenvían en cada turno el mismo mapa del repositorio, los mismos esquemas de herramientas y las mismas instrucciones, así que el precio de la caché domina la factura de tokens. También es la parte de la comparación que no puede empezar hoy.

Google no ha publicado los TTL de caché de Gemini 4, las tarifas de escritura o lectura, el alcance de la caché (caché automática de prefijos frente a objetos de caché explícitos) ni un tamaño mínimo cacheable. Sin esos cuatro valores no hay denominador: una lectura de caché de cinco minutos es un producto distinto de una lectura de una hora, y una caché de prefijos por petición es un producto distinto de una caché con nombre que comparten varios agentes. TTL, alcances de contexto y modos Batch distintos no pueden mezclarse en un solo número.

Fable 5.1 te da la estructura contra la que registrar. Anthropic documenta una escritura de caché de 5 minutos a $12.50 por MTok, una escritura de 1 hora a $20 por MTok, lecturas de caché a $0.25 por MTok y Batch al 50 % de la entrada y la salida estándar. Para cada traza de Fable, registra:

  • qué TTL se eligió y por qué (espaciado entre turnos inferior a cinco minutos, o pausas que justificaron la escritura de 1 hora);
  • el tamaño del prefijo en caché y con qué frecuencia cambió a mitad de tarea, ya que un prefijo modificado obliga a una nueva escritura;
  • tokens leídos de caché frente a tokens de entrada nueva por turno;
  • si la traza se ejecutó en Standard o Batch, y cómo combinaba la página de precios de Anthropic Batch con los modificadores de caché en el momento de la ejecución.
Conserva esos campos por traza, no por mes. Cuando Gemini 4 publique un contrato de caché sabrás cuáles de tus trazas siquiera calificarían para su caché, en lugar de comparar dos precios de lista que describen objetos distintos. Las tarifas de EvoLink para Fable 5.1 están en la página de producto.

Coste de reintentos, recuperación y toma de control humana

Esta es la capa que una tabla de especificaciones nunca muestra y donde se pierde realmente la mayor parte de los presupuestos de agentes de larga duración. Una traza que termina al tercer intento después de que un humano la desbloqueara no cuesta lo mismo que una traza que terminó a la primera. Registra seis eventos por traza, cada uno con marca de tiempo y recuento de tokens:

  1. Detección de bucles. La misma tool call con los mismos argumentos repetida más allá de un umbral fijado de antemano. Registra cuántos turnos se quemaron antes de que se activara la regla de parada.
  2. Tool calls fallidas. Separa los errores del lado del proveedor, los del lado de la herramienta y las llamadas mal formadas del lado del modelo. Solo el tercero es una señal de calidad del modelo; los otros dos son coste de infraestructura que una ruta nueva también pagará.
  3. Integridad de los checkpoints. Verifica que cada estado guardado puede restaurar realmente la tarea. Un checkpoint que no puede reanudarse es salida desperdiciada más una reejecución completa.
  4. Reanudación tras una interrupción. Cuenta los tokens gastados en reconstruir el contexto tras un rate limit, un timeout o una pausa del operador, por separado de los tokens de la primera ejecución.
  5. Invalidación de thinking blocks. La guía de migración de Anthropic documenta que editar turnos anteriores invalida los thinking blocks retenidos de Fable 5.1. Cualquier framework que reescriba el historial para compactar o corregir lo activará; registra con qué frecuencia y cuánto cuesta volver a pensar. Si Gemini 4 tiene una regla equivalente no está publicado.
  6. Toma de control humana. Minutos de revisor dedicados a desbloquear, corregir o terminar la tarea, registrados como tiempo para que nunca desaparezcan dentro de un total de API.

Guárdalos como campos en el registro de la traza, no en un registro de incidentes aparte; el coste por tarea aceptada solo tiene sentido si los reintentos, las reanudaciones y los minutos de revisor están en el mismo ID de tarea que los tokens.

La tabla completa de variables del coste por tarea

El denominador de todas las cifras siguientes son las tareas que se completaron y superaron la aceptación. Las tareas que se completaron pero fallaron la revisión cuentan en el gasto (se pagaron), pero no en el denominador. El gasto en API y el tiempo humano se mantienen en columnas separadas; convierte los minutos a dinero solo en la capa de informes, a una tarifa que sea propiedad de tu equipo financiero.

VariableCómo registrarla en Fable 5.1 hoyEstado en Gemini 4
Tokens de entradaEntrada nueva (sin caché) por turno, sumada por tarea, a partir de los contadores de uso que devuelve EvoLinkDesconocido hasta que se publique el contrato
Escritura de cachéTokens escritos, divididos por TTL de 5 minutos y de 1 hora, con el número de escrituras por tareaDesconocido hasta que se publique el contrato
Lectura de cachéTokens servidos desde caché por tarea; registra también la tasa de aciertos (lectura de caché / (lectura de caché + entrada nueva))Desconocido hasta que se publique el contrato
Tokens de salidaRespuesta final más argumentos de herramientas intermedios, sumados por tareaDesconocido hasta que se publique el contrato
Tool calls y coste externoRecuento y cualquier coste medido (búsqueda, ejecución de código, API de terceros) por tareaDesconocido hasta que se publique el contrato
ReintentosIntentos más allá del primero, con tokens por intento, adjuntos al mismo ID de tareaDesconocido hasta que se publique el contrato
Uso de la ruta de respaldoSi algún turno fue servido por otro modelo, y cuál, verificado mediante el campo model devueltoDesconocido hasta que se publique el contrato
Minutos de revisión humanaTiempo de revisor y operador por tarea, registrado en minutosSe mide en tus propias ejecuciones cuando exista una ruta; no es un dato publicado por el proveedor
Tiempo de reloj hasta la aceptaciónTiempo desde el inicio de la tarea hasta el resultado aceptado, incluidas esperas y turnos humanosSe mide en tus propias ejecuciones cuando exista una ruta; no es un dato publicado por el proveedor
Tasa de tareas aceptadasTareas aceptadas / tareas intentadas por clase de carga de trabajo en la ventanaSe mide en tus propias ejecuciones cuando exista una ruta; no es un dato publicado por el proveedor

El coste por tarea aceptada es el gasto en API dividido por las tareas aceptadas, reportado junto a los minutos de revisión por tarea aceptada. Una ruta que reduce lo primero mientras aumenta lo segundo no ha reducido el coste; lo ha trasladado a las personas.

Aceptación de la calidad de finalización

Una rúbrica de aceptación que solo funciona con un modelo es una preferencia, no una rúbrica. Construye la aceptación para que sobreviva a un cambio de modelo:

  • Primero, comprobaciones objetivas. Los tests pasan, el esquema valida, las citas resuelven, el diff toca solo los archivos declarados. Binarias y baratas de ejecutar en cada traza.
  • Segundo, rúbrica del revisor. Una lista de comprobación corta y fija por clase de carga de trabajo (corrección, completitud, seguridad, fidelidad al brief), puntuada por revisores que no saben qué ruta produjo la salida.
  • Ejecuciones repetidas. Ejecuta cada tarea más de una vez y reporta la tasa de tareas aceptadas como un rango, para que un éxito de una sola ejecución no se promocione como una capacidad.
  • Informe de incertidumbre. Publica el tamaño de muestra, los ajustes (esfuerzo, herramientas, TTL) y la lista de fallos junto a cada resultado. Una tasa sin tamaño de muestra no es evidencia.

Escribe la rúbrica antes de que exista cualquier acceso a Gemini 4; escrita después, se doblará alrededor de lo que la ruta nueva resulte hacer bien.

Tráfico en sombra y plan de reversión

Cuando una ruta de Gemini 4 exista por fin, debería entrar por las mismas tres etapas que cualquier ruta nueva, con Fable 5.1 conservado como referencia medida durante todo el proceso.

  1. Replay. Alimenta al candidato offline con trazas grabadas de Fable 5.1; compara la tasa de tareas aceptadas y el coste por tarea aceptada sobre entradas idénticas.
  2. Sombra. Envía las peticiones reales a ambas rutas, sirve la respuesta de Fable 5.1 y puntúa al candidato en silencio. Esto saca a la luz bucles y errores de herramientas sin exponer a los usuarios.
  3. Canary. Enruta una clase de carga de trabajo con una cuota pequeña; amplía solo cuando las puertas se mantengan durante toda la ventana de observación.

Puertas de promoción, fijadas antes de que empiece la prueba: tasa de tareas aceptadas igual o superior a la referencia; p95 del tiempo de reloj hasta la aceptación dentro del límite acordado; coste por tarea aceptada, incluidos reintentos y respaldo, igual o inferior a la referencia; cero incidentes para la clase de carga de trabajo durante la ventana.

Disparador de reversión: cualquier puerta que falle durante el número acordado de días consecutivos, o un incidente que llegue a un cliente. La reversión es un cambio de configuración del gateway, no un despliegue de código, y por eso la selección de modelo pertenece a la configuración de enrutamiento y no al código de la aplicación.

La verificación de la "identidad de modelo devuelta" significa leer el campo model y los contadores de uso en cada respuesta y comprobar que coinciden con la ruta configurada. En un gateway, esto confirma que una petición la sirvió el modelo que pediste y no, en silencio, un respaldo. Hazlo en la primera petición de cualquier ruta nueva y de forma continua en sombra; registra el resultado en el campo de ruta de respaldo de la tabla de costes.

Qué no contaría como progreso

  • Una ventana de contexto de Gemini 4 rumoreada más grande sin tareas largas completadas que la respalden.
  • Un precio de titular más bajo que se ve compensado por reintentos, reanudaciones, salidas más largas o minutos extra de revisión.
  • Capturas de benchmarks filtradas o tablas de especificaciones de terceros sin ajustes, tamaño de muestra ni un conjunto de tareas reproducible.
  • Una ruta que devuelve un modelo anterior o un respaldo opaco mientras lleva el nombre nuevo.
  • Una victoria de un solo día en tareas aceptadas que desaparece en ejecuciones repetidas o en la ventana de observación completa.

Escribe estas reglas de rechazo ahora, en el mismo documento que la rúbrica de aceptación. Los equipos que se saltan este paso tienden a redefinir el éxito alrededor del primer resultado emocionante.

Evaluar Claude Fable 5.1 en EvoLink Seguir la disponibilidad de la API de Gemini 4

FAQ

¿Alguien puede demostrar hoy que Gemini 4 cuesta menos que Claude Fable 5.1 para agentes?

No. A 16 de septiembre de 2026, Google no ha publicado precio, regla de caché, ventana de contexto ni entrada en la API para Gemini 4, así que cualquier afirmación de coste en cualquier dirección carece de denominador publicado. Registra ahora tu coste por tarea aceptada en Fable 5.1 para que una afirmación posterior tenga algo contra lo que comprobarse.

¿Pueden compararse directamente los precios de caché entre proveedores?

No como cifras aisladas. Una lectura de caché solo es comparable cuando el TTL, el alcance de la caché (prefijo frente a explícita), el tamaño mínimo cacheable y el modo Standard frente a Batch están todos igualados. Anthropic documenta los niveles de escritura de 5 minutos y 1 hora de Fable 5.1 y su tarifa de lectura; Gemini 4 no ha publicado ninguno de ellos.

¿Cómo cuento el coste de una tarea de larga duración fallida?

Adjunta cada intento, reanudación y minuto de revisor al mismo ID de tarea. Las tareas fallidas y no aceptadas permanecen en el gasto total, pero no en el denominador de tareas aceptadas. Reporta el gasto en API por tarea aceptada y los minutos de revisión por tarea aceptada como dos cifras, nunca fusionadas.

¿Cómo registro las funciones que Gemini 4 no ha publicado?

Crea el campo con el valor "No publicado a [fecha]". No lo rellenes con un valor de Gemini 3.x, una cifra filtrada ni un cero. Cuando Google publique un contrato, sustituye el marcador y anota la fecha del cambio para que las comparaciones históricas sigan siendo honestas.

¿Cómo conservo mi referencia verificada de Claude mientras pruebo una ruta nueva?

Mantén la ruta de Fable 5.1 configurada y sirviendo mientras el candidato pasa por replay, sombra y canary. Congela el conjunto de tareas, la rúbrica y los evaluadores antes de la prueba, y guarda las cifras de referencia con su fecha y sus ajustes; una referencia que se mueve durante la prueba no es una referencia. Anthropic recomienda empezar la mayoría de las cargas de trabajo en Claude Opus 5 y reservar Fable 5.1 para razonamiento exigente o trabajo de largo horizonte, así que declara cuál es realmente la ruta de Claude de tu referencia.
EvoLink tiene una ruta configurada con el nombre claude-fable-5-1. Verifica la identidad de modelo devuelta y los contadores de uso en tu primera petición antes de enrutar tráfico de producción, y consulta el precio actual en la página de producto de Claude Fable 5.1. La disponibilidad en el gateway no es un veredicto de producción; ese veredicto sale de tus propios resultados de replay, sombra y canary.

Fuentes

Evidencias revisadas el 16 de septiembre de 2026. Los hechos de Anthropic proceden de la documentación de Anthropic; los de Google, del blog oficial de Google y de la documentación de la Gemini API. Gemini 4 no tiene API pública ni ruta en EvoLink.

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.