MiniMax H3 (Hailuo 3) ya está en EvoLinkPruébalo con 10 créditos gratis
Un gran clúster de aceleradores frente a una pasarela API gestionada para desplegar Kimi K3
analysis

Cómo ejecutar Kimi K3 localmente: hardware y costes

EvoLink Team
EvoLink Team
Product Team
27 de julio de 2026
13 min de lectura

Respuesta directa: Kimi K3 puede ejecutarse localmente en infraestructura propia, pero el modelo completo no es un LLM local para un ordenador convencional. Los pesos se pueden descargar sin pagar una licencia del modelo; el coste real está en los aceleradores, el almacenamiento, la red, el trabajo de ingeniería y la operación continua.

Kimi K3 tiene una escala extraordinaria: el repositorio oficial del modelo de Moonshot ocupa aproximadamente 1,56 TB, el modelo contiene 2,8 billones de parámetros totales y activa 104.000 millones por token, y Moonshot recomienda un supernodo con 64 o más aceleradores para una inferencia eficiente. Los pesos están disponibles; la dificultad operativa también es real.
Esta guía cubre el despliegue propio, los límites de la licencia, una tabla de decisión y un marco mensual de TCO. Si el volumen es bajo o variable, empezar con una API de pago por uso suele resultar más barato. Mide primero el coste por tarea completada y vuelve a evaluar el autoalojamiento cuando la utilización sea predecible.

Qué significa realmente «ejecutar Kimi K3 gratis y en local»

AfirmaciónInterpretación correctaCoste que permanece
«Los pesos son gratis»Moonshot permite obtener, usar, modificar, desplegar, ajustar y distribuir K3 bajo su licencia personalizadaAlmacenamiento, descarga, aceleradores, electricidad, serving, monitorización y personal
«Funciona en local»El modelo puede servirse con motores compatibles sobre infraestructura controlada por tu equipoPara el modelo completo, «local» significa un clúster considerable, no un portátil normal
«La API ofrece una prueba gratis»Algunos usuarios nuevos de la API de Kimi reciben un cupónEl centro de ayuda chino de Kimi indica que el cupón de ¥15 no puede usarse con Kimi K3
«Los pesos abiertos eliminan el coste de API»Al operar tu propio stack no pagas una tarifa por token al editor de los pesosEl gasto variable de API se sustituye por capacidad y operaciones
La formulación precisa es: descargar los pesos es gratis; ejecutar el modelo completo en local no lo es. La decisión debe basarse en el coste total de propiedad.

Datos confirmados para desplegar Kimi K3

Los siguientes datos se verificaron el 27 de julio de 2026 con fuentes de Moonshot y de los motores compatibles.

Variable de despliegueValor confirmadoConsecuencia para la planificación
Parámetros totales2,8TNo se puede reutilizar la planificación de capacidad de un modelo local de 7B–70B
Parámetros activos104B por tokenLa activación dispersa reduce el cómputo, pero no elimina el almacenamiento ni el enrutamiento de los pesos de expertos
Formato de pesos y activacionesPesos MXFP4, activaciones MXFP8La cuantización publicada busca eficiencia, pero sigue dependiendo del soporte de hardware y kernels
Tamaño del repositorioUnos 1,56 TB en 96 fragmentosHace falta capacidad adicional para versiones, caché, logs y rollback
Ventana de contexto1.048.576 tokensLa memoria de estado/KV y el prefill de contexto largo pueden dominar la capacidad
Topología recomendadaSupernodo con 64+ aceleradoresEs una recomendación para inferencia eficiente en producción, no un mínimo universal de arranque
Motores compatiblesvLLM, SGLang, TokenSpeedConviene usar las recetas específicas para K3, no flags genéricos de una sola GPU
«64+ aceleradores recomendados» no significa que K3 sea incapaz de arrancar con menos. La generación del hardware, la memoria, la interconexión, el contexto, la concurrencia, el paralelismo y el objetivo de latencia cambian el mínimo viable. Aun así, K3 completo es un proyecto de clúster, no un modelo local de un clic para un PC.

Cómo desplegar Kimi K3 por tu cuenta

La entrada de software es sencilla; la infraestructura y la operación en producción son la parte difícil.

1. Revisar la licencia antes de descargar

La licencia de Kimi K3 permite usar, modificar, distribuir, ajustar, desplegar y crear obras derivadas. Es una licencia personalizada, no Apache 2.0 ni MIT.

Tres cláusulas merecen revisión jurídica:

  • Si el titular y sus afiliadas operan un negocio Model-as-a-Service y superan 20 millones de dólares de ingresos agregados durante cualquier periodo consecutivo de 12 meses, deben firmar un acuerdo separado con Moonshot antes del uso comercial.
  • Un producto comercial con más de 100 millones de usuarios activos mensuales o más de 20 millones de dólares de ingresos mensuales debe mostrar «Kimi K3» de forma destacada.
  • Los dos requisitos anteriores no se aplican al uso interno definido por la licencia ni al uso mediante productos oficiales de Moonshot y socios de inferencia certificados.

Este resumen ayuda a decidir, pero no es asesoramiento jurídico. Conserva los avisos de licencia y copyright y pide una interpretación profesional para tu producto.

2. Planificar los artefactos y la transferencia

El repositorio contiene 96 fragmentos safetensors y suma unos 1,56 TB. No dimensionarlo exactamente a 1,56 TB: hay que reservar espacio para versiones, caché de descarga y rollback.
pip install -U "huggingface_hub[cli]"
huggingface-cli download moonshotai/Kimi-K3 \
  --local-dir /models/Kimi-K3

Fija una revisión para builds reproducibles, conserva checksums o un manifiesto, separa los artefactos inmutables de la caché de servicio y planifica cómo distribuir una versión nueva a todos los workers sin saturar la red de producción.

3. Elegir un motor compatible

La ficha del modelo menciona vLLM, SGLang y TokenSpeed. La receta actual de K3 para vLLM clasifica el soporte como preliminar y requiere una imagen vLLM 0.26.0+ compatible con K3. La base de validación en un solo nodo es de al menos 8× GB300; la ruta AMD necesita al menos 8× MI355X o MI350X. La recomendación de Moonshot de un supernodo con 64+ aceleradores sigue siendo para inferencia eficiente en producción, no un mínimo universal de validación.
Si los pesos ya están en /models/Kimi-K3, usa la imagen específica de K3 en un nodo NVIDIA de validación con ocho GPU y declara el paralelismo:
docker run --rm --gpus all --ipc=host \
  -p 8000:8000 \
  -v /models/Kimi-K3:/models/Kimi-K3:ro \
  vllm/vllm-openai:kimi-k3 \
  --model /models/Kimi-K3 \
  --tensor-parallel-size 8 \
  --trust-remote-code \
  --load-format fastsafetensors \
  --moe-backend auto \
  --gpu-memory-utilization 0.95 \
  --max-model-len 32768 \
  --reasoning-parser kimi_k3 \
  --enable-auto-tool-choice \
  --tool-call-parser kimi_k3

Esta es una configuración de validación limitada, no un despliegue multinodo completo. El límite inicial de contexto de 32K deja margen de capacidad; auméntalo solo después de medir memoria y concurrencia. Producción sigue requiriendo la receta upstream adecuada para la topología, paralelismo Tensor/Expert/Data, kernels específicos, configuración del scheduler, health checks y pruebas de capacidad.

4. Demostrar corrección antes que rendimiento

Prueba entradas de texto e imagen, reasoning_content, pensamiento conservado entre turnos, tool calling, salida estructurada, contexto largo, cancelación y reintentos. Un HTTP 200 no demuestra que el despliegue sea correcto. Compara un conjunto fijo de evaluación con la ruta gestionada antes de mover tráfico.

5. Añadir el sistema de producción que falta

El autoalojamiento también exige:

  • balanceo de carga, control de admisión, colas y backpressure;
  • monitorización de time to first token, rendimiento, caché, errores y salud de aceleradores;
  • autoescalado o una política deliberada de capacidad fija;
  • actualizaciones progresivas, rollback de artefactos y upgrades del motor;
  • controles de abuso, autenticación, rate limits, logs de auditoría y retención;
  • responsabilidad on-call para workers fallidos, problemas de interconexión, regresiones y agotamiento de capacidad.
El clúster y la operación determinan el coste real, no el primer comando vllm serve.
Dos rutas de producción para Kimi K3: un clúster autoalojado de varias etapas y una API gestionada conectan con la misma aplicación
Dos rutas de producción para Kimi K3: un clúster autoalojado de varias etapas y una API gestionada conectan con la misma aplicación

Calcular el TCO mensual de Kimi K3

Una comparación útil mantiene visibles las dos fórmulas:

managed_api_cost =
  uncached_input_tokens × live_input_rate
  + cached_input_tokens × live_cache_rate
  + output_tokens × live_output_rate

self_host_monthly_tco =
  accelerator_and_infrastructure
  + engineering_and_operations
  + one_time_setup / amortization_months

No conviertas un precio de GPU encontrado en Internet en una oferta real. Solicita una cotización para la topología necesaria e incluye almacenamiento, red, soporte, redundancia, utilización y personal.

Primero decide si tu equipo encaja con el autoalojamiento; después calcula el coste:
Tu situaciónMejor punto de partidaMotivo
Desarrollador individual, evaluación o prototipoAPI gestionadaSin compromiso de clúster; solo se paga el uso medido
Equipo pequeño con tráfico bajo, variable o desconocidoAPI gestionadaLos costes fijos de infraestructura y on-call son difíciles de amortizar
K3 es una ruta dentro de un producto multimodeloAPI unificada de EvoLinkK3, modelos pequeños y fallbacks permanecen detrás de una sola integración
Producción estable y de gran volumenCalcular ambas opcionesLa utilización real y las ofertas de proveedores pueden justificar capacidad propia
Residencia de datos estricta o personalización de pesosPuede encajar el autoalojamientoEl control de infraestructura puede pesar más que el coste
Clúster de inferencia y equipo de operaciones existentesEl autoalojamiento es viableGran parte del coste fijo de plataforma y personal ya existe

Después recopila todos los costes propios antes de compararlos con el precio vigente por uso:

Área de costeQué incluir
Artefactos del modeloUnos 1,56 TB por copia, además de descarga, staging, versiones, caché y rollback
Clúster de inferenciaTopología de aceleradores, memoria host, CPUs e interconexión para el objetivo de latencia y concurrencia; Moonshot recomienda 64+ aceleradores
Almacenamiento y redAlmacenamiento persistente, tráfico entre nodos, distribución de artefactos, logs y egress
IngenieríaIntegración, servicio distribuido, evaluación, optimización, upgrades y respuesta a incidentes
DisponibilidadCapacidad de reserva, health checks, failover, monitorización, backups y cobertura on-call
Licencia y cumplimientoRevisión legal, avisos, control de acceso, auditoría, privacidad y residencia
Sin volumen estable, una oferta real del clúster y un equipo responsable de inferencia, no conviene empezar por el autoalojamiento. Empieza por uso medido en EvoLink, recoge entre 30 y 60 días de datos reales y vuelve a calcular.
No existe un punto de equilibrio universal que merezca publicarse. Un precio de hardware demasiado bajo produciría una respuesta falsa; el coste gestionado actual puede consultarse en la página de Kimi K3.

Cuándo es mejor el autoalojamiento

Puede ser razonable cuando coinciden varias condiciones:

  • una demanda sostenida mantiene el clúster muy utilizado;
  • privacidad o residencia exigen infraestructura bajo control propio;
  • el equipo ya opera grandes sistemas de inferencia distribuida;
  • se necesitan cambios de pesos, fine-tuning o modificaciones profundas del serving;
  • el volumen predecible a largo plazo amortiza despliegue, soporte y renovación;
  • la licencia de Kimi K3 encaja con el modelo comercial.
El punto de equilibrio de una empresa con clúster propio no se puede trasladar a un equipo de cinco personas. Decide con uso observado y ofertas reales, no con el resultado de una calculadora universal.

Cuándo suele ser más barata una API gestionada

Para personas, startups y equipos pequeños, el acceso gestionado suele ser el punto de partida con menos riesgo. Especialmente cuando:
  • el tráfico es bajo, irregular, estacional o aún no está medido;
  • el equipo necesita entregar una función, no operar un clúster;
  • K3 es solo una ruta en un producto multimodelo;
  • todavía se está validando el ajuste del modelo al workload;
  • disponibilidad, recuperación y upgrades consumirían tiempo escaso;
  • una gran capacidad fija reduciría la flexibilidad para cambiar de modelo.
EvoLink ofrece kimi-k3 detrás de la misma pasarela API unificada que otros modelos. El equipo puede probar K3, mantener tareas rutinarias en modelos pequeños y conservar fallbacks. No hace falta comprar capacidad específica para K3 por adelantado. El precio actual está en la página de Kimi K3; la guía de la API explica requests, contexto, herramientas y migración.
Comparar precios actuales de la API de Kimi K3

Un despliegue más barato que conserva la opción de autoalojamiento

Toma la decisión por etapas:

  1. Empieza con tráfico de API medido. Registra entrada sin caché, lecturas de caché, salida, reintentos, latencia y tasa de tareas aceptadas.
  2. Enruta de forma selectiva. Deja clasificación, reescritura y tareas simples en modelos pequeños; escala trabajo de repositorios o herramientas a K3.
  3. Construye el TCO con demanda observada. Convierte entre 30 y 60 días de tokens y concurrencia en requisitos de capacidad.
  4. Obtén una oferta real de autoalojamiento. Incluye redundancia y operaciones, no solo alquiler de aceleradores.
  5. Ejecuta una prueba controlada. Valida calidad, rendimiento, contexto largo y recuperación antes de tratar el autoalojamiento como proyecto de ahorro.

La secuencia crea una referencia de volumen sin cerrar la puerta al despliegue privado. También evita comprar hardware suficiente para un benchmark pero insuficiente para la concurrencia y el on-call de producción.

Preguntas frecuentes

¿Kimi K3 es de código abierto?

Moonshot describe K3 como un modelo de pesos abiertos y publica código y pesos bajo la licencia personalizada Kimi K3 License. «Código abierto» puede implicar una definición concreta; «pesos abiertos bajo Kimi K3 License» es más preciso.

¿Puede Kimi K3 ejecutarse en un portátil?

No como modelo completo de 2,8T en una configuración práctica de producción. El repositorio ocupa unos 1,56 TB y Moonshot recomienda 64 o más aceleradores para inferencia eficiente. Pueden aparecer derivados más pequeños, pero serían artefactos distintos que requieren verificar calidad y licencia.

¿Puedo probar Kimi K3 gratis mediante la API oficial?

El centro de ayuda chino de Kimi indica que el cupón de ¥15 para nuevos usuarios no puede usarse con K3. Otros productos, promociones o terceros pueden cambiar; comprueba sus condiciones actuales.

¿Kimi K3 necesita exactamente 64 GPU?

Moonshot recomienda un supernodo con 64 o más aceleradores para inferencia eficiente, pero no lo publica como mínimo universal. La topología depende de memoria y formatos, interconexión, paralelismo, contexto, concurrencia y latencia.

¿Cuál es la forma más barata de evaluar Kimi K3?

Usa una API medida con un conjunto pequeño y representativo, reutiliza prefijos estables para la caché, limita la salida y mide el coste por tarea aceptada. Suele ser más barato que provisionar un clúster antes de conocer demanda y ajuste.

¿Cuándo debería un equipo pequeño reconsiderar el autoalojamiento?

Cuando el volumen mensual y la concurrencia sean estables, exista una oferta real de infraestructura, alguien sea responsable del serving y el acceso gestionado no satisfaga un requisito esencial. Compara coste mensual total y fiabilidad, no solo tarifas por token.

No. Una API compatible genera datos de uso, caché, latencia y salida para planificar capacidad. Mantén modular el adaptador, conserva fixtures de evaluación y trata el backend de inferencia como una ruta sustituible.

Fuentes y política de actualización

Fuentes primarias: ficha y repositorio de Kimi K3, Kimi K3 License, publicación técnica de Moonshot, avance de soporte de producción de vLLM y reglas de prueba gratuita de la API de Kimi. Revisa esta guía si Moonshot cambia la licencia, publica otra cuantización, actualiza las recetas o modifica la disponibilidad.

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.