Production routeThis rate reflects platform-side availability — only confirmed server errors (HTTP 500 / empty response) count as failures. User-side issues (content moderation, invalid params, cancellation) plus rate limits, timeouts and auth errors are excluded. Before real traffic arrives, empty buckets may display as available.LiveLiveLanguage model
USD and credits are shown per 1M tokens. Live prices for your user group override the fallback rates. Minimum total charge: 0.01 credits.
¿Qué es la API de DeepSeek V4 Pro?
DeepSeek V4 Pro es el nivel más potente de DeepSeek: arquitectura Mixture-of-Experts de 1,6 billones de parámetros (49B activos por token), contexto de 1 M de tokens, salida máxima de 384K y modo thinking activado por defecto. En EvoLink está disponible en /v1/chat/completions (estilo OpenAI) y /v1/messages (estilo Anthropic) con el ID deepseek-v4-pro. Consulta límites de precio, flujos admitidos y configuración en las secciones Pricing y API.
ID del modelo EvoLinkdeepseek-v4-pro
Las solicitudes de Chat Completions, Messages y Responses deben usar el ID exacto que se muestra aquí.
¿Para qué tareas es adecuada la API de DeepSeek V4 Pro?
DeepSeek V4 Pro combina una ventana de contexto de 1.000.000 tokens, razonamiento configurable y llamadas a herramientas para trabajos que deben conservar evidencia, llamar a sistemas externos y entregar resultados verificables. El modelo es solo de texto: no acepta entrada de imágenes. Estos casos de uso explican dónde puede aportar valor y qué confirmar antes de la integración.
Programación y revisión a escala de repositorio
Reúne código fuente, issues, resultados de pruebas y cambios anteriores para investigar problemas entre archivos, preparar implementaciones y revisar modificaciones. Antes del despliegue, usa tareas fijas para comprobar pruebas superadas, pasos omitidos, resultados estructurados y correcciones humanas necesarias.
Documentos largos y análisis de varias fuentes
La ventana de 1.000.000 tokens puede contener informes, contratos, fragmentos de bases de conocimiento, historial y fuentes recuperadas. Más contexto no garantiza una respuesta mejor: comprueba que se conserve la evidencia clave y usa las tarifas en tiempo real y el mecanismo de aciertos de caché de Pricing para calcular el coste por resultado aceptable.
Agentes de larga duración y flujos de terminal
La versión GA 0813 mejoró notablemente la programación agéntica y las tareas de terminal, justo donde los comentarios de la comunidad (una señal de demanda, no una conclusión verificada) sitúan con más frecuencia el valor de V4 Pro frente a modelos cerrados. Conecta tus propias herramientas de búsqueda y ejecución mediante function calling y valida la tasa de finalización de tareas de varios pasos con tus cargas reales antes de escalar.
Salida estructurada y orquestación de agentes
Las entradas de texto pueden alimentar JSON Schema, llamadas a funciones y agentes de varios pasos para extracción, revisión y automatización. Antes de producción, prueba la validez del esquema, los argumentos, el cierre del streaming y la recuperación segura tras un fallo de herramienta.
Elección del acceso API
¿Qué cambia al usar DeepSeek V4 Pro mediante distintas plataformas?
Aunque el modelo sea el mismo, la configuración de contexto, las herramientas, los datos de uso y la facturación pueden variar. EvoLink reúne configuración y consumo tras una sola API para simplificar futuros cambios de modelo.
Usar el ID de modelo API correcto
deepseek-v4-pro es la URL y una forma de búsqueda habitual; el ID que se envía en la API es deepseek-v4-pro. Las aplicaciones existentes con Chat Completions o Responses pueden cambiar la configuración del modelo. Los campos exactos siguen en la sección API.
Seguir la configuración del canal API actual
DeepSeek documenta una ventana de 1.000.000 tokens, pero cada plataforma puede ofrecer opciones de contexto, herramientas y límites distintos. En EvoLink, toma como referencia la configuración, las funciones disponibles y los datos usage mostrados para el canal actual.
Elegir Chat o Responses según el flujo
Empieza con Chat Completions para chat, streaming y funciones del cliente. Evalúa Responses, el protocolo añadido en la versión 0813, cuando necesites flujos de agentes largos de varios pasos; sus herramientas de servidor documentadas son function calling, web search y apply_patch, y code interpreter se ignora en esta ruta. Así conservas una integración de estilo OpenAI sin complejidad innecesaria.
Mantener abierta la elección de modelo
Una cuenta, saldo y patrón de API de EvoLink sirven para Grok, GPT, Claude y Kimi. Si el modelo permanece en configuración, el equipo puede enrutar por calidad, coste y disponibilidad sin reconstruir la aplicación para cada proveedor.
Control de costes
¿Cómo controlar mejor el coste de la API de DeepSeek V4 Pro?
Pricing muestra las tarifas actuales de tokens (entrada, acierto de caché, salida). La caché, la gestión del contexto, el nivel de razonamiento y el enrutamiento reducen consumo innecesario y relacionan el gasto con tareas terminadas.
Preparar el contexto repetido para la caché
Los prompts de sistema estables, esquemas de herramientas y contexto compartido son más fáciles de reutilizar. Configura el identificador de caché o conversación compatible con el protocolo y revisa cached tokens en usage para confirmar el beneficio real.
Enviar solo el contexto que necesita la tarea
La ventana de 1.000.000 tokens ayuda con repositorios y documentos grandes, pero no hay que llenarla siempre. Seleccionar archivos, mensajes y fragmentos relevantes reduce el coste de entrada y ayuda al modelo a centrarse en la evidencia decisiva.
Ajustar razonamiento, salida y herramientas
Las tareas sencillas pueden comenzar con reasoning effort bajo y una salida corta; aumenta el presupuesto en análisis difíciles. En investigación y agentes, controla también el número de herramientas para evitar búsquedas repetidas, ejecuciones inútiles o bucles.
Comparar modelos por coste total de la tarea
Evalúa tokens, entrada en caché, herramientas de servidor y reintentos dentro de la misma tarea completada. EvoLink centraliza modelos y uso para comparar el coste total del mismo trabajo con DeepSeek V4 Pro y otras rutas.
Recomendaciones para producción
¿Qué conviene confirmar antes de usar DeepSeek V4 Pro en producción?
Empieza con unas pocas cargas reales para confirmar calidad, latencia, coste y fiabilidad antes de trasladar más tráfico.
La integración y el uso son claros
Confirma el ID deepseek-v4-pro, el protocolo previsto y la devolución de respuestas, datos usage y caché. Un uso claro permite analizar costes y observar de forma coherente los flujos Chat y Responses.
Las salidas cumplen el requisito de negocio
Prueba cambios de código, documentos, investigación o extracción estructurada reales. Además de la respuesta, comprueba pruebas, fiabilidad de citas, argumentos de funciones y si el JSON Schema puede consumirse directamente en sistemas posteriores.
La latencia y los errores se pueden gestionar
Observa tiempos de respuesta con carga representativa y prepara reintentos para límites, timeouts, salidas estructuradas inválidas y fallos de herramientas. Un modelo configurable en EvoLink facilita cambiar a una alternativa verificada si una ruta no está disponible.
El coste y la elección del modelo siguen controlados
Calcula el coste total de la misma clase de tarea con Pricing, usage y el cargo final. Decide después si DeepSeek V4 Pro debe ser ruta predeterminada, modelo para tareas difíciles o respaldo. La gateway unificada separa esa decisión del trabajo de integración.
Empieza con un conjunto pequeño, observable y reversible de tareas en DeepSeek V4 Pro. Amplía solo cuando calidad, latencia y coste cumplan lo esperado. Mantener varios modelos tras la API unificada de EvoLink simplifica escalar, cambiar y optimizar costes.
Elección de protocolo y ruta
¿Cómo elegir Chat Completions, Responses y el tráfico de producción?
Cada protocolo sirve a flujos distintos. Este resumen ayuda a elegir; los campos exactos están en API y la documentación de EvoLink, y las tarifas de tokens en Pricing; al presupuestar, incluye las rondas de llamadas a herramientas en el coste total de la tarea.
01
Chat estándar y funciones del cliente: Chat Completions
Si ya usas chat compatible con OpenAI, streaming o funciones ejecutadas por el cliente, empieza con Chat Completions. Confirma formato de mensajes, cierre del flujo, argumentos de función y usage según lo que espera el cliente actual.
Chat y funciones del cliente
02
Flujos de agentes: Responses
Evalúa la API Responses, añadida en la versión 0813, para flujos de agentes de varios pasos más largos e integraciones de tipo Codex. Antes de integrar, confirma los campos admitidos, los estados de fallo y los límites de reintento en la documentación actual de EvoLink.
Flujos de agentes
03
Contexto grande: observar caché y coste total
Los documentos, repositorios y conversaciones largos no deben enviarse completos por defecto. Compara tamaños representativos, aciertos y fallos de caché, longitud de salida y reintentos, y usa el cargo final para calcular el coste de una tarea correcta.
Coste de contexto
04
Producción: empezar poco a poco y conservar respaldo
Envía primero un grupo pequeño y observable a DeepSeek V4 Pro y conserva una ruta GPT, Claude o Kimi ya probada. La API unificada de EvoLink centraliza modelo, uso y saldo y facilita cambiar tras límites, timeouts o fallos de esquema o herramienta.
Despliegue gradual
Modelos relacionados
GPT-5.6
La familia frontier escalonada de OpenAI para comparar capacidad, latencia y flexibilidad del enrutamiento por coste.
¿Ya está disponible la API de DeepSeek V4 Pro mediante EvoLink?
Sí. DeepSeek V4 Pro está disponible en la ruta de producción de EvoLink. Envía solicitudes con el ID deepseek-v4-pro mediante Chat Completions o Responses; el ID, los precios, el contexto y los flujos compatibles figuran en esta página.
¿deepseek-v4-pro es el ID del modelo API?
Sí. El ID que se envía en la solicitud es deepseek-v4-pro, la misma cadena que la URL de esta página. Desde el 13 de agosto de 2026, ese mismo ID apunta automáticamente a la versión GA 0813 actualizada; no hay que cambiar el ID para obtener la nueva versión.
¿Qué cambió en la versión 0813 de DeepSeek V4 Pro?
La versión GA 0813 (publicada el 13 de agosto de 2026) mejoró de forma sustancial los benchmarks de programación agéntica y tareas de terminal respecto a la preview de abril y añadió soporte de la API Responses. El ID invocable sigue siendo deepseek-v4-pro. Los alias antiguos deepseek-chat y deepseek-reasoner se retiraron en origen el 24 de julio de 2026.
¿Qué entradas y salidas admite DeepSeek V4 Pro?
Solo entrada de texto y salida de texto. DeepSeek V4 Pro no tiene capacidad de visión en ningún protocolo, pero los límites varían según la ruta: Messages rechaza los tipos de contenido de imagen y documento, mientras que Responses convierte los adjuntos de imagen y archivo en marcadores de posición en lugar de comprenderlos. Envía las tareas de comprensión de capturas o documentos a un modelo con visión en la misma gateway de EvoLink.
¿Debo usar Chat Completions o la API Responses?
Chat Completions sirve para chat, streaming y funciones del cliente. Evalúa Responses, añadida en la versión 0813, para flujos de agentes de larga duración. Los campos exactos se mantienen en API y la documentación de EvoLink.
¿Cómo se debe elegir el reasoning effort?
Los niveles válidos son low, high y max, y el predeterminado es high: medium se acepta pero se asigna en silencio a high, por lo que comparar medium con high no produce ninguna diferencia real. Empieza el trabajo rutinario con low, compara low y high en las mismas tareas y reserva max para los problemas más difíciles, donde un intento fallido cuesta más que los tokens de razonamiento adicionales.
¿Cómo afecta la entrada en caché al precio de DeepSeek V4 Pro?
Puede reducir el coste del contexto repetido, pero los fallos de caché, salidas largas, reintentos y herramientas repetidas aumentan el total. Usa Pricing y el cargo final para calcular el coste por tarea correcta.
¿Cuáles son los límites de velocidad de DeepSeek V4 Pro?
En origen no hay límite de RPM ni TPM por token. La restricción es un tope de concurrencia por cuenta: unas 500 solicitudes simultáneas en el nivel Pro, con 429 al superarlo y desconexión tras unos 10 minutos en cola. Mantén las solicitudes en curso por debajo de tu tope medido, usa backoff exponencial y envía los pasos masivos a DeepSeek V4 Flash, cuyo tope es unas cinco veces mayor.
¿Cómo comparar DeepSeek V4 Pro con GPT, Claude o Kimi?
Ejecuta las mismas tareas reales con contexto, herramientas y razonamiento iguales. Compara calidad, tiempo de respuesta, mezcla de tokens, rendimiento de herramientas y coste total para asignar cada tráfico a una ruta de EvoLink.
¿DeepSeek V4 Pro es de código abierto?
Los pesos de la preview de abril están publicados con licencia MIT en Hugging Face; a 13 de agosto de 2026, los pesos de la versión GA 0813 aún no se habían publicado. Los pesos abiertos y la API alojada son vías de acceso independientes: la ruta de EvoLink sirve la API alojada, y que esos mismos pesos MIT estén disponibles en alojamientos de terceros es lo que hace posible el respaldo mediante un host de terceros.
¿Existe un modelo DeepSeek V4 Pro Max?
No. No existe un modelo «Pro Max» separado: «max» es el nivel máximo de thinking sobre el mismo ID de modelo deepseek-v4-pro. Si ves mencionado «Pro-Max», se refiere a ejecutar este modelo con el esfuerzo de razonamiento máximo, no a otro producto.
¿Qué modelo de respaldo conviene conservar?
Conserva un modelo que ya gestione la misma carga con fiabilidad y mantén la ruta configurable. Ante límites, timeouts o salidas inválidas, EvoLink puede cambiar a GPT, Claude, Kimi u otra alternativa adecuada.