Seedance 2.5 ya está disponible en EvoLinkProbar Seedance 2.5

DeepSeek V4 Flash API

DeepSeek-Generación de texto-desde $0.148 / 1 M de tokens de entrada-Disponible
Contexto de 1MSalida máx. de 384KModo thinkingChat + Messages + Responses
Production routeLive
Proveedor
DeepSeek
Modelo
DeepSeek V4 Flash
Ventana de contexto
1.000.000 tokens
Protocolos
Chat + Messages + Responses

Elegir DeepSeek V4 Flash

Una ruta de evaluación para programación, razonamiento y contexto largo, disponible en Chat Completions, Messages y Responses.

DeepSeek V4 Flash

Modelo de DeepSeek para razonamiento y uso de herramientas

Seleccionado
Desde $0.148 / 1 M de tokens de entradadeepseek-v4-flash
Ideal para

Cargas grandes de programación, razonamiento, análisis de documentos largos y agentes que necesitan una ruta económica con precio de entrada en caché.

Entrada
$0.148 / 1M
10 cr / 1M
Entrada en caché
$0.0030 / 1M
0.2 cr / 1M
Salida
$0.295 / 1M
20 cr / 1M

DeepSeek V4 Flash Precios

Estimate uncached input, cached input, and output tokens together. Live prices for your user group override the contract-backed fallback rates.

DeepSeek V4 Flash

Request calculator

Enter uncached input, cached input, and output tokens.

Estimated request cost

DeepSeek V4 Flash
USD$0.0003
Credits0.0161
Uncached input tokens0.01 cr
Cached input tokens0.0001 cr
Output tokens0.006 cr

Budget guide

Approximate requests using the current mix.
Add credits
$10
About 42236 requests

For quick testing

$50
About 211180 requests

For regular development

$100
About 422360 requests

For production evaluation

Token rates

ModelPrompt tokensUncached input tokensCached input tokensOutput tokens
DeepSeek V4 Flashdeepseek-v4-flash1M
$0.148 / 1M
10 cr / 1M
$0.0030 / 1M
0.2 cr / 1M
$0.295 / 1M
20 cr / 1M

USD and credits are shown per 1M tokens. Live prices for your user group override the fallback rates. Minimum total charge: 0.01 credits.

¿Qué es la API de DeepSeek V4 Flash?

DeepSeek V4 Flash es el modelo general rápido de DeepSeek: arquitectura Mixture-of-Experts de 284B parámetros (13B activos por token) con un módulo integrado de decodificación especulativa DSpark que acelera la generación, contexto de 1 M de tokens, salida máxima de 384K y modo thinking opcional. En EvoLink está disponible en /v1/chat/completions (estilo OpenAI) y /v1/messages (estilo Anthropic) con el ID deepseek-v4-flash. Consulta límites de precio, flujos admitidos y configuración en las secciones Pricing y API.

DeepSeek V4 Flash
ID del modelo EvoLinkdeepseek-v4-flash

Las solicitudes de Chat Completions, Messages y Responses deben usar el ID exacto que se muestra aquí.

Parámetros del modelo

Ventana de contexto1.000.000 tokens
Protocolos APIChat Completions · Messages · Responses
Modo thinkingOpcional por solicitud
Salida máx.384.000 tokens
Facturación de tokensEntrada · caché · salida
ProveedorDeepSeek
Tareas y flujos de trabajo

¿Para qué tareas es adecuada la API de DeepSeek V4 Flash?

DeepSeek V4 Flash combina una ventana de contexto de 1.000.000 tokens, razonamiento configurable y llamadas a herramientas. El modelo es solo de texto: las entradas de imagen se rechazan. Resulta útil cuando el trabajo debe conservar evidencia, llamar a sistemas externos y entregar resultados verificables.

Programación y revisión a escala de repositorio

Reúne código fuente, issues, resultados de pruebas y cambios anteriores para investigar problemas entre archivos, preparar implementaciones y revisar modificaciones. Antes del despliegue, usa tareas fijas para comprobar pruebas superadas, pasos omitidos, resultados estructurados y correcciones humanas necesarias.

Documentos largos y análisis de varias fuentes

La ventana de 1.000.000 tokens puede contener informes, contratos, fragmentos de bases de conocimiento, historial y fuentes recuperadas. Más contexto no garantiza una respuesta mejor: comprueba que se conserve la evidencia clave y usa las tarifas en vivo y el mecanismo de caché de Pricing para calcular el coste por resultado aceptable.

Agentes y lotes de alta concurrencia

El build GA 0731 mejoró el rendimiento de agentes y llamadas a herramientas, y el alto límite de concurrencia por cuenta de Flash encaja con pipelines paralelos. Conecta tus propias herramientas de búsqueda y ejecución mediante llamadas a funciones y valida la tasa de finalización de tareas de varios pasos en tus cargas reales antes de escalar.

Salida estructurada y orquestación de agentes

Las entradas de texto pueden alimentar JSON Schema, llamadas a funciones y agentes de varios pasos para extracción, revisión y automatización. Antes de producción, prueba la validez del esquema, los argumentos, el cierre del streaming y la recuperación segura tras un fallo de herramienta.

Elección del acceso API

¿Qué cambia al usar DeepSeek V4 Flash mediante distintas plataformas?

Aunque el modelo sea el mismo, la configuración de contexto, las herramientas, los datos de uso y la facturación pueden variar. EvoLink reúne configuración y consumo tras una sola API para simplificar futuros cambios de modelo.

Usar el ID de modelo API correcto

deepseek-v4-flash es la URL y una forma de búsqueda habitual; el ID que se envía en la API es deepseek-v4-flash. Las aplicaciones existentes con Chat Completions o Responses pueden cambiar la configuración del modelo. Los campos exactos siguen en la sección API.

Seguir la configuración del canal API actual

DeepSeek documenta una ventana de 1.000.000 tokens, pero cada plataforma puede ofrecer opciones de contexto, herramientas y límites distintos. En EvoLink, toma como referencia la configuración, las funciones disponibles y los datos usage mostrados para el canal actual.

Elegir Chat o Responses según el flujo

Empieza con Chat Completions para chat, streaming y funciones del cliente. Evalúa el protocolo Responses, añadido con el build 0731, para flujos de agentes de varios pasos más largos; sus herramientas de servidor documentadas son function calling, web search y apply_patch, y code interpreter se ignora en esta ruta. Así conservas una integración de estilo OpenAI sin complejidad innecesaria.

Mantener abierta la elección de modelo

Una cuenta, saldo y patrón de API de EvoLink sirven para Grok, GPT, Claude y Kimi. Si el modelo permanece en configuración, el equipo puede enrutar por calidad, coste y disponibilidad sin reconstruir la aplicación para cada proveedor.

Control de costes

¿Cómo controlar mejor el coste de la API de DeepSeek V4 Flash?

Pricing muestra las tarifas actuales de tokens (entrada, acierto de caché, salida). La caché, la gestión del contexto, el nivel de razonamiento y el enrutamiento reducen consumo innecesario y relacionan el gasto con tareas terminadas.

Preparar el contexto repetido para la caché

Los prompts de sistema estables, esquemas de herramientas y contexto compartido son más fáciles de reutilizar. Configura el identificador de caché o conversación compatible con el protocolo y revisa cached tokens en usage para confirmar el beneficio real.

Enviar solo el contexto que necesita la tarea

La ventana de 1.000.000 tokens ayuda con repositorios y documentos grandes, pero no hay que llenarla siempre. Seleccionar archivos, mensajes y fragmentos relevantes reduce el coste de entrada y ayuda al modelo a centrarse en la evidencia decisiva.

Ajustar razonamiento, salida y herramientas

Las tareas sencillas pueden comenzar con reasoning effort bajo y una salida corta; aumenta el presupuesto en análisis difíciles. En investigación y agentes, controla también el número de herramientas para evitar búsquedas repetidas, ejecuciones inútiles o bucles.

Comparar modelos por coste total de la tarea

Evalúa tokens, entrada en caché, herramientas de servidor y reintentos dentro de la misma tarea completada. EvoLink centraliza modelos y uso para comparar el coste total del mismo trabajo con DeepSeek V4 Flash y otras rutas.

Recomendaciones para producción

¿Qué conviene confirmar antes de usar DeepSeek V4 Flash en producción?

Empieza con unas pocas cargas reales para confirmar calidad, latencia, coste y fiabilidad antes de trasladar más tráfico.

La integración y el uso son claros

Confirma el ID deepseek-v4-flash, el protocolo previsto y la devolución de respuestas, datos usage y caché. Un uso claro permite analizar costes y observar de forma coherente los flujos Chat y Responses.

Las salidas cumplen el requisito de negocio

Prueba cambios de código, documentos, investigación o extracción estructurada reales. Además de la respuesta, comprueba pruebas, fiabilidad de citas, argumentos de funciones y si el JSON Schema puede consumirse directamente en sistemas posteriores.

La latencia y los errores se pueden gestionar

Observa tiempos de respuesta con carga representativa y prepara reintentos para límites, timeouts, salidas estructuradas inválidas y fallos de herramientas. Un modelo configurable en EvoLink facilita cambiar a una alternativa verificada si una ruta no está disponible.

El coste y la elección del modelo siguen controlados

Calcula el coste total de la misma clase de tarea con Pricing, usage y el cargo final. Decide después si DeepSeek V4 Flash debe ser ruta predeterminada, modelo para tareas difíciles o respaldo. La gateway unificada separa esa decisión del trabajo de integración.

Empieza con un conjunto pequeño, observable y reversible de tareas en DeepSeek V4 Flash. Amplía solo cuando calidad, latencia y coste cumplan lo esperado. Mantener varios modelos tras la API unificada de EvoLink simplifica escalar, cambiar y optimizar costes.

Elección de protocolo y ruta

¿Cómo elegir Chat Completions, Responses y el tráfico de producción?

Cada protocolo sirve a flujos distintos. Este resumen ayuda a elegir; los campos exactos están en API y la documentación de EvoLink, y las tarifas de tokens en Pricing; al presupuestar, incluye las rondas de llamadas a herramientas en el coste total de la tarea.

01

Chat estándar y funciones del cliente: Chat Completions

Si ya usas chat compatible con OpenAI, streaming o funciones ejecutadas por el cliente, empieza con Chat Completions. Confirma formato de mensajes, cierre del flujo, argumentos de función y usage según lo que espera el cliente actual.

Chat y funciones del cliente
02

Flujos de agentes: Responses

Evalúa la API Responses, añadida con el build 0731, para flujos de agentes de varios pasos e integraciones de tipo Codex. Confirma los campos admitidos, los estados de fallo y los límites de reintento con la documentación actual de EvoLink antes de integrar.

Flujos de agentes
03

Contexto grande: observar caché y coste total

Los documentos, repositorios y conversaciones largos no deben enviarse completos por defecto. Compara tamaños representativos, aciertos y fallos de caché, longitud de salida y reintentos, y usa el cargo final para calcular el coste de una tarea correcta.

Coste de contexto
04

Producción: empezar poco a poco y conservar respaldo

Envía primero un grupo pequeño y observable a DeepSeek V4 Flash y conserva una ruta GPT, Claude o Kimi ya probada. La API unificada de EvoLink centraliza modelo, uso y saldo y facilita cambiar tras límites, timeouts o fallos de esquema o herramienta.

Despliegue gradual

Modelos relacionados

GPT-5.6

GPT-5.6

La familia frontier escalonada de OpenAI para comparar capacidad, latencia y flexibilidad del enrutamiento por coste.

Ver modelo
Claude Opus 5

Claude Opus 5

La ruta premium de Anthropic para agentes de larga duración, uso de herramientas y revisiones complejas.

Ver modelo
Kimi K3

Kimi K3

La ruta de razonamiento con contexto largo de Moonshot y una tarifa separada para entrada en caché.

Ver modelo
DeepSeek V4 Pro

DeepSeek V4 Pro

Una ruta open model de bajo coste para grandes cargas de programación, razonamiento y agentes.

Ver modelo

Guías relacionadas y actualización de DeepSeek V4 Flash

Cómo usar la API de DeepSeek V4 Pro

Cómo usar la API de DeepSeek V4 Pro

Primera llamada, control del thinking y una estrategia para repartir el tráfico entre Flash y Pro.

Leer la guía
DeepSeek V4 0813 ya está disponible: qué cambió

DeepSeek V4 0813 ya está disponible: qué cambió

Los cambios de agente y Codex de los builds GA, verificados con la documentación de origen.

Leer la guía
Análisis de la API DeepSeek V4: Flash o Pro

Análisis de la API DeepSeek V4: Flash o Pro

Compara coste, modo thinking y una checklist de puesta en producción.

Leer la guía
DeepSeek V4 vs GPT-5.4 vs Claude Opus 4.6

DeepSeek V4 vs GPT-5.4 vs Claude Opus 4.6

Precios oficiales y capacidades de tres rutas frontier.

Leer la guía

Preguntas frecuentes de la API de DeepSeek V4 Flash

¿Ya está disponible la API de DeepSeek V4 Flash mediante EvoLink?

Sí. DeepSeek V4 Flash está disponible en la ruta de producción de EvoLink. Envía solicitudes con el ID deepseek-v4-flash mediante Chat Completions o Responses; el ID, los precios, el contexto y los flujos compatibles figuran en esta página.

¿deepseek-v4-flash es el ID del modelo API?

Sí. El ID que se envía en la solicitud es deepseek-v4-flash, la misma cadena que la URL de esta página. La versión GA actual es el build 0731 (estable desde el 31 de julio de 2026); el ID sin cambios lo sirve automáticamente. Los alias antiguos deepseek-chat y deepseek-reasoner se retiraron en origen el 24 de julio de 2026.

¿Cuál es la ventana de contexto y cómo se factura?

DeepSeek documenta 1.000.000 tokens. No existe un tramo de precio separado para contexto largo: la facturación sigue las tarifas en vivo por token y el mecanismo de entrada en caché de Pricing. Prueba tamaños representativos y aciertos de caché en vez de usar siempre toda la ventana.

¿Qué entradas y salidas admite DeepSeek V4 Flash?

Solo entrada y salida de texto. DeepSeek V4 Flash no tiene capacidad de visión en ningún protocolo, pero los límites varían según la ruta: Messages rechaza los tipos de contenido de imagen y documento, mientras que Responses convierte los adjuntos de imagen y archivo en marcadores de posición en lugar de comprenderlos. Dirige las tareas de comprensión de capturas o documentos a un modelo con visión en la misma gateway de EvoLink.

¿Debo usar Chat Completions o la API Responses?

Chat Completions sirve para chat, streaming y funciones del cliente. Evalúa Responses, añadido con el build 0731, para flujos de agentes más largos. Los campos exactos se mantienen en API y la documentación de EvoLink.

¿Cómo se debe elegir el reasoning effort?

Los niveles válidos son low, high y max, y el predeterminado es high: medium se acepta pero se asigna en silencio a high, por lo que comparar medium con high no produce ninguna diferencia real. Empieza el trabajo rutinario con low, compara low y high en las mismas tareas y reserva max para los problemas más difíciles, donde un intento fallido cuesta más que los tokens de razonamiento adicionales.

¿Cómo afecta la entrada en caché al precio de DeepSeek V4 Flash?

Puede reducir el coste del contexto repetido, pero los fallos de caché, salidas largas, reintentos y herramientas repetidas aumentan el total. Usa Pricing y el cargo final para calcular el coste por tarea correcta.

¿Qué límites de velocidad tiene DeepSeek V4 Flash?

No hay límite RPM ni TPM en origen. La restricción es un tope de concurrencia por cuenta: alrededor de 2.500 solicitudes simultáneas en el nivel Flash, unas cinco veces el de Pro. Al superarlo se devuelve 429 y, tras unos 10 minutos de cola, la solicitud se desconecta. Ese margen es la ventaja de rendimiento de Flash: mantén las solicitudes en vuelo por debajo de tu tope medido, usa backoff exponencial y aprovéchalo para lotes de alta concurrencia.

¿Cuándo elegir Flash y cuándo Pro?

Elige Flash para clasificación, resúmenes, ediciones cortas y pipelines por lotes de alta concurrencia: ahí pesan su velocidad y un tope de concurrencia unas cinco veces mayor. Elige Pro para cadenas de agentes de más de ocho pasos y tareas sensibles a los hechos, donde la profundidad de razonamiento importa más que el rendimiento. Ambos niveles comparten la misma API de EvoLink, así que enrutar por tipo de tarea es solo un cambio de configuración.

¿Cómo comparar DeepSeek V4 Flash con GPT, Claude o Kimi?

Ejecuta las mismas tareas reales con contexto, herramientas y razonamiento iguales. Compara calidad, tiempo de respuesta, mezcla de tokens, rendimiento de herramientas y coste total para asignar cada tráfico a una ruta de EvoLink.

¿DeepSeek V4 Flash es de código abierto?

Sí: los pesos del build Flash 0731 están publicados con licencia MIT en Hugging Face. Los pesos abiertos y la API alojada son vías de acceso independientes: la ruta de EvoLink sirve la API alojada, y esos mismos pesos MIT en alojamientos de terceros son lo que hace posible el enrutamiento de respaldo.

¿Qué modelo de respaldo conviene conservar?

Conserva un modelo que ya gestione la misma carga con fiabilidad y mantén la ruta configurable. Ante límites, timeouts o salidas inválidas, EvoLink puede cambiar a GPT, Claude, Kimi u otra alternativa adecuada.