
Gemini 4 vs Claude Fable 5.1: agentes de larga duración
Tabla de estado y evidencias
| Pregunta | Gemini 4 | Claude Fable 5.1 | Decisión segura |
|---|---|---|---|
| Estado oficial | Preentrenamiento confirmado por Google (julio de 2026) | Lanzado por Anthropic el 1 de septiembre de 2026; marcado como Active (latest) | Trata la brecha como una brecha de estado, no como un veredicto de capacidad |
| ID de modelo de API | No publicado | claude-fable-5-1 (Anthropic) | Nunca pongas un ID no publicado en configuración ni en código |
| Contexto y salida máxima | No publicados | 1M de contexto; 128K de salida máxima (Anthropic) | Registra cuánto de la ventana consumen realmente tus trazas |
| Modalidades de entrada | No publicadas | Entrada de texto e imagen, salida de texto (Anthropic) | Lista las modalidades que cada carga de trabajo requiere antes de probar |
| Controles de thinking | No publicados | Thinking adaptativo siempre activo; esfuerzo predeterminado high; latencia comparativa listada como Slower (Anthropic) | Registra el ajuste de esfuerzo por traza para que una ruta posterior se pruebe con ajustes equivalentes |
| Estructura de precios de caché | No publicada | Entrada $10 / salida $50 por MTok; escritura de caché de 5 minutos $12.50; escritura de caché de 1 hora $20; lectura de caché $0.25 por MTok (lista de Anthropic) | La economía de la caché no puede compararse hasta que ambos lados publiquen TTL y tarifas |
| Disponibilidad de Batch | No publicada | Anthropic lista Batch con entrada y salida al 50 % del estándar | Compara Standard con Standard, Batch con Batch |
| Cambios incompatibles documentados | No publicados | Tres en la guía de migración de Anthropic: errores con tool choice forzado, incompatibilidad de modelos anteriores con los thinking blocks de 5.1, thinking blocks invalidados tras editar turnos anteriores | Una lista publicada de cambios incompatibles es comprobable; una ausente no lo es |
| Ruta de EvoLink | Sin ruta invocable verificada; alerta de lanzamiento abierta | Ruta configurada claude-fable-5-1; precio en la página de producto | Verifica la identidad de modelo devuelta en la primera petición de cualquier ruta |
La columna de Gemini 4 es una lista de lo que puede medirse, no una crítica. Cada celda "No publicado" es un campo para el que tu harness ya debería tener un hueco, de modo que un contrato publicado rellene valores en lugar de forzar un rediseño.
Qué tareas de larga duración merece la pena evaluar
El trabajo de agentes de larga duración no es una única carga de trabajo. Cinco clases de tarea cubren la mayoría de las trazas que los equipos enrutan a Fable 5.1, cada una con su propia definición de "aceptada". Registra la referencia por clase; juzga también por clase cualquier ruta futura de Gemini 4.
| Carga de trabajo | Qué significa "aceptada" | Qué registrar en Fable 5.1 ahora | Qué debe igualar después una ruta de Gemini 4 |
|---|---|---|---|
| Reparación de repositorios multiarchivo | Los tests pasan, el diff se revisa, no se tocan archivos no relacionados | Archivos leídos y editados, tool calls, reintentos, minutos de revisor, tokens por corrección aceptada | Mismo conjunto de tareas, suite de tests y rúbrica del revisor |
| Investigación multipaso y entregables de conocimiento | Las citas resuelven, la estructura coincide con el brief, sin afirmaciones sin respaldo | Fuentes consultadas, revisiones solicitadas, correcciones factuales por entregable | Mismos briefs y misma pasada de verificación de hechos |
| Bucles de herramientas de varias horas | El bucle termina en la condición de parada con un estado final válido | Número de bucles, tool calls fallidas, checkpoints, eventos de reanudación, tiempo de reloj hasta la terminación | Mismas herramientas, permisos, presupuesto de reintentos y reglas de parada |
| Extracción estructurada sobre documentos largos | La salida valida contra el esquema; los campos muestreados coinciden con la fuente | Longitud del documento, fallos de esquema, reejecuciones, precisión de campos sobre una muestra fija | Mismos documentos, esquema y muestra |
| Flujos multipaso de atención al cliente con herramientas | Ticket resuelto dentro de la política sin escalado humano | Escalados, llamadas a herramienta incorrecta, violaciones de política, tiempo de gestión | Mismas definiciones de flujo y comprobaciones de política |
Ninguna fila nombra un modelo preferido, porque no existe ninguna ejecución equivalente. La tabla solo fija qué significará "la misma tarea" cuando una segunda ruta esté disponible.
Reutilización de contexto y condiciones de caché
Los agentes de larga duración reenvían en cada turno el mismo mapa del repositorio, los mismos esquemas de herramientas y las mismas instrucciones, así que el precio de la caché domina la factura de tokens. También es la parte de la comparación que no puede empezar hoy.
Google no ha publicado los TTL de caché de Gemini 4, las tarifas de escritura o lectura, el alcance de la caché (caché automática de prefijos frente a objetos de caché explícitos) ni un tamaño mínimo cacheable. Sin esos cuatro valores no hay denominador: una lectura de caché de cinco minutos es un producto distinto de una lectura de una hora, y una caché de prefijos por petición es un producto distinto de una caché con nombre que comparten varios agentes. TTL, alcances de contexto y modos Batch distintos no pueden mezclarse en un solo número.
Fable 5.1 te da la estructura contra la que registrar. Anthropic documenta una escritura de caché de 5 minutos a $12.50 por MTok, una escritura de 1 hora a $20 por MTok, lecturas de caché a $0.25 por MTok y Batch al 50 % de la entrada y la salida estándar. Para cada traza de Fable, registra:
- qué TTL se eligió y por qué (espaciado entre turnos inferior a cinco minutos, o pausas que justificaron la escritura de 1 hora);
- el tamaño del prefijo en caché y con qué frecuencia cambió a mitad de tarea, ya que un prefijo modificado obliga a una nueva escritura;
- tokens leídos de caché frente a tokens de entrada nueva por turno;
- si la traza se ejecutó en Standard o Batch, y cómo combinaba la página de precios de Anthropic Batch con los modificadores de caché en el momento de la ejecución.
Coste de reintentos, recuperación y toma de control humana
Esta es la capa que una tabla de especificaciones nunca muestra y donde se pierde realmente la mayor parte de los presupuestos de agentes de larga duración. Una traza que termina al tercer intento después de que un humano la desbloqueara no cuesta lo mismo que una traza que terminó a la primera. Registra seis eventos por traza, cada uno con marca de tiempo y recuento de tokens:
- Detección de bucles. La misma tool call con los mismos argumentos repetida más allá de un umbral fijado de antemano. Registra cuántos turnos se quemaron antes de que se activara la regla de parada.
- Tool calls fallidas. Separa los errores del lado del proveedor, los del lado de la herramienta y las llamadas mal formadas del lado del modelo. Solo el tercero es una señal de calidad del modelo; los otros dos son coste de infraestructura que una ruta nueva también pagará.
- Integridad de los checkpoints. Verifica que cada estado guardado puede restaurar realmente la tarea. Un checkpoint que no puede reanudarse es salida desperdiciada más una reejecución completa.
- Reanudación tras una interrupción. Cuenta los tokens gastados en reconstruir el contexto tras un rate limit, un timeout o una pausa del operador, por separado de los tokens de la primera ejecución.
- Invalidación de thinking blocks. La guía de migración de Anthropic documenta que editar turnos anteriores invalida los thinking blocks retenidos de Fable 5.1. Cualquier framework que reescriba el historial para compactar o corregir lo activará; registra con qué frecuencia y cuánto cuesta volver a pensar. Si Gemini 4 tiene una regla equivalente no está publicado.
- Toma de control humana. Minutos de revisor dedicados a desbloquear, corregir o terminar la tarea, registrados como tiempo para que nunca desaparezcan dentro de un total de API.
Guárdalos como campos en el registro de la traza, no en un registro de incidentes aparte; el coste por tarea aceptada solo tiene sentido si los reintentos, las reanudaciones y los minutos de revisor están en el mismo ID de tarea que los tokens.
La tabla completa de variables del coste por tarea
El denominador de todas las cifras siguientes son las tareas que se completaron y superaron la aceptación. Las tareas que se completaron pero fallaron la revisión cuentan en el gasto (se pagaron), pero no en el denominador. El gasto en API y el tiempo humano se mantienen en columnas separadas; convierte los minutos a dinero solo en la capa de informes, a una tarifa que sea propiedad de tu equipo financiero.
| Variable | Cómo registrarla en Fable 5.1 hoy | Estado en Gemini 4 |
|---|---|---|
| Tokens de entrada | Entrada nueva (sin caché) por turno, sumada por tarea, a partir de los contadores de uso que devuelve EvoLink | Desconocido hasta que se publique el contrato |
| Escritura de caché | Tokens escritos, divididos por TTL de 5 minutos y de 1 hora, con el número de escrituras por tarea | Desconocido hasta que se publique el contrato |
| Lectura de caché | Tokens servidos desde caché por tarea; registra también la tasa de aciertos (lectura de caché / (lectura de caché + entrada nueva)) | Desconocido hasta que se publique el contrato |
| Tokens de salida | Respuesta final más argumentos de herramientas intermedios, sumados por tarea | Desconocido hasta que se publique el contrato |
| Tool calls y coste externo | Recuento y cualquier coste medido (búsqueda, ejecución de código, API de terceros) por tarea | Desconocido hasta que se publique el contrato |
| Reintentos | Intentos más allá del primero, con tokens por intento, adjuntos al mismo ID de tarea | Desconocido hasta que se publique el contrato |
| Uso de la ruta de respaldo | Si algún turno fue servido por otro modelo, y cuál, verificado mediante el campo model devuelto | Desconocido hasta que se publique el contrato |
| Minutos de revisión humana | Tiempo de revisor y operador por tarea, registrado en minutos | Se mide en tus propias ejecuciones cuando exista una ruta; no es un dato publicado por el proveedor |
| Tiempo de reloj hasta la aceptación | Tiempo desde el inicio de la tarea hasta el resultado aceptado, incluidas esperas y turnos humanos | Se mide en tus propias ejecuciones cuando exista una ruta; no es un dato publicado por el proveedor |
| Tasa de tareas aceptadas | Tareas aceptadas / tareas intentadas por clase de carga de trabajo en la ventana | Se mide en tus propias ejecuciones cuando exista una ruta; no es un dato publicado por el proveedor |
El coste por tarea aceptada es el gasto en API dividido por las tareas aceptadas, reportado junto a los minutos de revisión por tarea aceptada. Una ruta que reduce lo primero mientras aumenta lo segundo no ha reducido el coste; lo ha trasladado a las personas.
Aceptación de la calidad de finalización
Una rúbrica de aceptación que solo funciona con un modelo es una preferencia, no una rúbrica. Construye la aceptación para que sobreviva a un cambio de modelo:
- Primero, comprobaciones objetivas. Los tests pasan, el esquema valida, las citas resuelven, el diff toca solo los archivos declarados. Binarias y baratas de ejecutar en cada traza.
- Segundo, rúbrica del revisor. Una lista de comprobación corta y fija por clase de carga de trabajo (corrección, completitud, seguridad, fidelidad al brief), puntuada por revisores que no saben qué ruta produjo la salida.
- Ejecuciones repetidas. Ejecuta cada tarea más de una vez y reporta la tasa de tareas aceptadas como un rango, para que un éxito de una sola ejecución no se promocione como una capacidad.
- Informe de incertidumbre. Publica el tamaño de muestra, los ajustes (esfuerzo, herramientas, TTL) y la lista de fallos junto a cada resultado. Una tasa sin tamaño de muestra no es evidencia.
Escribe la rúbrica antes de que exista cualquier acceso a Gemini 4; escrita después, se doblará alrededor de lo que la ruta nueva resulte hacer bien.
Tráfico en sombra y plan de reversión
Cuando una ruta de Gemini 4 exista por fin, debería entrar por las mismas tres etapas que cualquier ruta nueva, con Fable 5.1 conservado como referencia medida durante todo el proceso.
- Replay. Alimenta al candidato offline con trazas grabadas de Fable 5.1; compara la tasa de tareas aceptadas y el coste por tarea aceptada sobre entradas idénticas.
- Sombra. Envía las peticiones reales a ambas rutas, sirve la respuesta de Fable 5.1 y puntúa al candidato en silencio. Esto saca a la luz bucles y errores de herramientas sin exponer a los usuarios.
- Canary. Enruta una clase de carga de trabajo con una cuota pequeña; amplía solo cuando las puertas se mantengan durante toda la ventana de observación.
Puertas de promoción, fijadas antes de que empiece la prueba: tasa de tareas aceptadas igual o superior a la referencia; p95 del tiempo de reloj hasta la aceptación dentro del límite acordado; coste por tarea aceptada, incluidos reintentos y respaldo, igual o inferior a la referencia; cero incidentes para la clase de carga de trabajo durante la ventana.
Disparador de reversión: cualquier puerta que falle durante el número acordado de días consecutivos, o un incidente que llegue a un cliente. La reversión es un cambio de configuración del gateway, no un despliegue de código, y por eso la selección de modelo pertenece a la configuración de enrutamiento y no al código de la aplicación.
model y los contadores de uso en cada respuesta y comprobar que coinciden con la ruta configurada. En un gateway, esto confirma que una petición la sirvió el modelo que pediste y no, en silencio, un respaldo. Hazlo en la primera petición de cualquier ruta nueva y de forma continua en sombra; registra el resultado en el campo de ruta de respaldo de la tabla de costes.Qué no contaría como progreso
- Una ventana de contexto de Gemini 4 rumoreada más grande sin tareas largas completadas que la respalden.
- Un precio de titular más bajo que se ve compensado por reintentos, reanudaciones, salidas más largas o minutos extra de revisión.
- Capturas de benchmarks filtradas o tablas de especificaciones de terceros sin ajustes, tamaño de muestra ni un conjunto de tareas reproducible.
- Una ruta que devuelve un modelo anterior o un respaldo opaco mientras lleva el nombre nuevo.
- Una victoria de un solo día en tareas aceptadas que desaparece en ejecuciones repetidas o en la ventana de observación completa.
Escribe estas reglas de rechazo ahora, en el mismo documento que la rúbrica de aceptación. Los equipos que se saltan este paso tienden a redefinir el éxito alrededor del primer resultado emocionante.
Evaluar Claude Fable 5.1 en EvoLink Seguir la disponibilidad de la API de Gemini 4FAQ
¿Alguien puede demostrar hoy que Gemini 4 cuesta menos que Claude Fable 5.1 para agentes?
No. A 16 de septiembre de 2026, Google no ha publicado precio, regla de caché, ventana de contexto ni entrada en la API para Gemini 4, así que cualquier afirmación de coste en cualquier dirección carece de denominador publicado. Registra ahora tu coste por tarea aceptada en Fable 5.1 para que una afirmación posterior tenga algo contra lo que comprobarse.
¿Pueden compararse directamente los precios de caché entre proveedores?
No como cifras aisladas. Una lectura de caché solo es comparable cuando el TTL, el alcance de la caché (prefijo frente a explícita), el tamaño mínimo cacheable y el modo Standard frente a Batch están todos igualados. Anthropic documenta los niveles de escritura de 5 minutos y 1 hora de Fable 5.1 y su tarifa de lectura; Gemini 4 no ha publicado ninguno de ellos.
¿Cómo cuento el coste de una tarea de larga duración fallida?
Adjunta cada intento, reanudación y minuto de revisor al mismo ID de tarea. Las tareas fallidas y no aceptadas permanecen en el gasto total, pero no en el denominador de tareas aceptadas. Reporta el gasto en API por tarea aceptada y los minutos de revisión por tarea aceptada como dos cifras, nunca fusionadas.
¿Cómo registro las funciones que Gemini 4 no ha publicado?
Crea el campo con el valor "No publicado a [fecha]". No lo rellenes con un valor de Gemini 3.x, una cifra filtrada ni un cero. Cuando Google publique un contrato, sustituye el marcador y anota la fecha del cambio para que las comparaciones históricas sigan siendo honestas.
¿Cómo conservo mi referencia verificada de Claude mientras pruebo una ruta nueva?
¿Fable 5.1 está disponible en EvoLink ahora?
claude-fable-5-1. Verifica la identidad de modelo devuelta y los contadores de uso en tu primera petición antes de enrutar tráfico de producción, y consulta el precio actual en la página de producto de Claude Fable 5.1. La disponibilidad en el gateway no es un veredicto de producción; ese veredicto sale de tus propios resultados de replay, sombra y canary.Fuentes
- Anthropic: descripción del modelo Claude Fable 5.1
- Anthropic: guía de migración a Claude Fable 5.1
- Anthropic: precios, TTL de caché y Batch
- Anthropic: anuncio de Claude Fable 5.1
- Anthropic: página de producto de Claude Fable
- Anthropic: retirada de modelos
- Google: mensaje del CEO sobre los resultados del segundo trimestre de 2026 de Alphabet
- Google: anuncio de Gemini 3.6 Flash
- Google: catálogo de modelos de la Gemini API
- Estado de la API de Gemini 4 en EvoLink
- EvoLink: Claude Fable 5.1
- EvoLink: seguimiento del lanzamiento de Gemini 4
- EvoLink: Claude Fable 5.1 vs GPT-6 Astra


