
Cómo ejecutar Kimi K3 localmente: hardware y costes
Respuesta directa: Kimi K3 puede ejecutarse localmente en infraestructura propia, pero el modelo completo no es un LLM local para un ordenador convencional. Los pesos se pueden descargar sin pagar una licencia del modelo; el coste real está en los aceleradores, el almacenamiento, la red, el trabajo de ingeniería y la operación continua.
Qué significa realmente «ejecutar Kimi K3 gratis y en local»
| Afirmación | Interpretación correcta | Coste que permanece |
|---|---|---|
| «Los pesos son gratis» | Moonshot permite obtener, usar, modificar, desplegar, ajustar y distribuir K3 bajo su licencia personalizada | Almacenamiento, descarga, aceleradores, electricidad, serving, monitorización y personal |
| «Funciona en local» | El modelo puede servirse con motores compatibles sobre infraestructura controlada por tu equipo | Para el modelo completo, «local» significa un clúster considerable, no un portátil normal |
| «La API ofrece una prueba gratis» | Algunos usuarios nuevos de la API de Kimi reciben un cupón | El centro de ayuda chino de Kimi indica que el cupón de ¥15 no puede usarse con Kimi K3 |
| «Los pesos abiertos eliminan el coste de API» | Al operar tu propio stack no pagas una tarifa por token al editor de los pesos | El gasto variable de API se sustituye por capacidad y operaciones |
Datos confirmados para desplegar Kimi K3
Los siguientes datos se verificaron el 27 de julio de 2026 con fuentes de Moonshot y de los motores compatibles.
| Variable de despliegue | Valor confirmado | Consecuencia para la planificación |
|---|---|---|
| Parámetros totales | 2,8T | No se puede reutilizar la planificación de capacidad de un modelo local de 7B–70B |
| Parámetros activos | 104B por token | La activación dispersa reduce el cómputo, pero no elimina el almacenamiento ni el enrutamiento de los pesos de expertos |
| Formato de pesos y activaciones | Pesos MXFP4, activaciones MXFP8 | La cuantización publicada busca eficiencia, pero sigue dependiendo del soporte de hardware y kernels |
| Tamaño del repositorio | Unos 1,56 TB en 96 fragmentos | Hace falta capacidad adicional para versiones, caché, logs y rollback |
| Ventana de contexto | 1.048.576 tokens | La memoria de estado/KV y el prefill de contexto largo pueden dominar la capacidad |
| Topología recomendada | Supernodo con 64+ aceleradores | Es una recomendación para inferencia eficiente en producción, no un mínimo universal de arranque |
| Motores compatibles | vLLM, SGLang, TokenSpeed | Conviene usar las recetas específicas para K3, no flags genéricos de una sola GPU |
Cómo desplegar Kimi K3 por tu cuenta
1. Revisar la licencia antes de descargar
Tres cláusulas merecen revisión jurídica:
- Si el titular y sus afiliadas operan un negocio Model-as-a-Service y superan 20 millones de dólares de ingresos agregados durante cualquier periodo consecutivo de 12 meses, deben firmar un acuerdo separado con Moonshot antes del uso comercial.
- Un producto comercial con más de 100 millones de usuarios activos mensuales o más de 20 millones de dólares de ingresos mensuales debe mostrar «Kimi K3» de forma destacada.
- Los dos requisitos anteriores no se aplican al uso interno definido por la licencia ni al uso mediante productos oficiales de Moonshot y socios de inferencia certificados.
Este resumen ayuda a decidir, pero no es asesoramiento jurídico. Conserva los avisos de licencia y copyright y pide una interpretación profesional para tu producto.
2. Planificar los artefactos y la transferencia
safetensors y suma unos 1,56 TB. No dimensionarlo exactamente a 1,56 TB: hay que reservar espacio para versiones, caché de descarga y rollback.pip install -U "huggingface_hub[cli]"
huggingface-cli download moonshotai/Kimi-K3 \
--local-dir /models/Kimi-K3Fija una revisión para builds reproducibles, conserva checksums o un manifiesto, separa los artefactos inmutables de la caché de servicio y planifica cómo distribuir una versión nueva a todos los workers sin saturar la red de producción.
3. Elegir un motor compatible
/models/Kimi-K3, usa la imagen específica de K3 en un nodo NVIDIA de validación con ocho GPU y declara el paralelismo:docker run --rm --gpus all --ipc=host \
-p 8000:8000 \
-v /models/Kimi-K3:/models/Kimi-K3:ro \
vllm/vllm-openai:kimi-k3 \
--model /models/Kimi-K3 \
--tensor-parallel-size 8 \
--trust-remote-code \
--load-format fastsafetensors \
--moe-backend auto \
--gpu-memory-utilization 0.95 \
--max-model-len 32768 \
--reasoning-parser kimi_k3 \
--enable-auto-tool-choice \
--tool-call-parser kimi_k3Esta es una configuración de validación limitada, no un despliegue multinodo completo. El límite inicial de contexto de 32K deja margen de capacidad; auméntalo solo después de medir memoria y concurrencia. Producción sigue requiriendo la receta upstream adecuada para la topología, paralelismo Tensor/Expert/Data, kernels específicos, configuración del scheduler, health checks y pruebas de capacidad.
4. Demostrar corrección antes que rendimiento
reasoning_content, pensamiento conservado entre turnos, tool calling, salida estructurada, contexto largo, cancelación y reintentos. Un HTTP 200 no demuestra que el despliegue sea correcto. Compara un conjunto fijo de evaluación con la ruta gestionada antes de mover tráfico.5. Añadir el sistema de producción que falta
El autoalojamiento también exige:
- balanceo de carga, control de admisión, colas y backpressure;
- monitorización de time to first token, rendimiento, caché, errores y salud de aceleradores;
- autoescalado o una política deliberada de capacidad fija;
- actualizaciones progresivas, rollback de artefactos y upgrades del motor;
- controles de abuso, autenticación, rate limits, logs de auditoría y retención;
- responsabilidad on-call para workers fallidos, problemas de interconexión, regresiones y agotamiento de capacidad.
vllm serve.
Calcular el TCO mensual de Kimi K3
Una comparación útil mantiene visibles las dos fórmulas:
managed_api_cost =
uncached_input_tokens × live_input_rate
+ cached_input_tokens × live_cache_rate
+ output_tokens × live_output_rate
self_host_monthly_tco =
accelerator_and_infrastructure
+ engineering_and_operations
+ one_time_setup / amortization_monthsNo conviertas un precio de GPU encontrado en Internet en una oferta real. Solicita una cotización para la topología necesaria e incluye almacenamiento, red, soporte, redundancia, utilización y personal.
| Tu situación | Mejor punto de partida | Motivo |
|---|---|---|
| Desarrollador individual, evaluación o prototipo | API gestionada | Sin compromiso de clúster; solo se paga el uso medido |
| Equipo pequeño con tráfico bajo, variable o desconocido | API gestionada | Los costes fijos de infraestructura y on-call son difíciles de amortizar |
| K3 es una ruta dentro de un producto multimodelo | API unificada de EvoLink | K3, modelos pequeños y fallbacks permanecen detrás de una sola integración |
| Producción estable y de gran volumen | Calcular ambas opciones | La utilización real y las ofertas de proveedores pueden justificar capacidad propia |
| Residencia de datos estricta o personalización de pesos | Puede encajar el autoalojamiento | El control de infraestructura puede pesar más que el coste |
| Clúster de inferencia y equipo de operaciones existentes | El autoalojamiento es viable | Gran parte del coste fijo de plataforma y personal ya existe |
Después recopila todos los costes propios antes de compararlos con el precio vigente por uso:
| Área de coste | Qué incluir |
|---|---|
| Artefactos del modelo | Unos 1,56 TB por copia, además de descarga, staging, versiones, caché y rollback |
| Clúster de inferencia | Topología de aceleradores, memoria host, CPUs e interconexión para el objetivo de latencia y concurrencia; Moonshot recomienda 64+ aceleradores |
| Almacenamiento y red | Almacenamiento persistente, tráfico entre nodos, distribución de artefactos, logs y egress |
| Ingeniería | Integración, servicio distribuido, evaluación, optimización, upgrades y respuesta a incidentes |
| Disponibilidad | Capacidad de reserva, health checks, failover, monitorización, backups y cobertura on-call |
| Licencia y cumplimiento | Revisión legal, avisos, control de acceso, auditoría, privacidad y residencia |
Sin volumen estable, una oferta real del clúster y un equipo responsable de inferencia, no conviene empezar por el autoalojamiento. Empieza por uso medido en EvoLink, recoge entre 30 y 60 días de datos reales y vuelve a calcular.
Cuándo es mejor el autoalojamiento
Puede ser razonable cuando coinciden varias condiciones:
- una demanda sostenida mantiene el clúster muy utilizado;
- privacidad o residencia exigen infraestructura bajo control propio;
- el equipo ya opera grandes sistemas de inferencia distribuida;
- se necesitan cambios de pesos, fine-tuning o modificaciones profundas del serving;
- el volumen predecible a largo plazo amortiza despliegue, soporte y renovación;
- la licencia de Kimi K3 encaja con el modelo comercial.
Cuándo suele ser más barata una API gestionada
- el tráfico es bajo, irregular, estacional o aún no está medido;
- el equipo necesita entregar una función, no operar un clúster;
- K3 es solo una ruta en un producto multimodelo;
- todavía se está validando el ajuste del modelo al workload;
- disponibilidad, recuperación y upgrades consumirían tiempo escaso;
- una gran capacidad fija reduciría la flexibilidad para cambiar de modelo.
kimi-k3 detrás de la misma pasarela API unificada que otros modelos. El equipo puede probar K3, mantener tareas rutinarias en modelos pequeños y conservar fallbacks. No hace falta comprar capacidad específica para K3 por adelantado. El precio actual está en la página de Kimi K3; la guía de la API explica requests, contexto, herramientas y migración.Un despliegue más barato que conserva la opción de autoalojamiento
Toma la decisión por etapas:
- Empieza con tráfico de API medido. Registra entrada sin caché, lecturas de caché, salida, reintentos, latencia y tasa de tareas aceptadas.
- Enruta de forma selectiva. Deja clasificación, reescritura y tareas simples en modelos pequeños; escala trabajo de repositorios o herramientas a K3.
- Construye el TCO con demanda observada. Convierte entre 30 y 60 días de tokens y concurrencia en requisitos de capacidad.
- Obtén una oferta real de autoalojamiento. Incluye redundancia y operaciones, no solo alquiler de aceleradores.
- Ejecuta una prueba controlada. Valida calidad, rendimiento, contexto largo y recuperación antes de tratar el autoalojamiento como proyecto de ahorro.
La secuencia crea una referencia de volumen sin cerrar la puerta al despliegue privado. También evita comprar hardware suficiente para un benchmark pero insuficiente para la concurrencia y el on-call de producción.
Preguntas frecuentes
¿Kimi K3 es de código abierto?
¿Puede Kimi K3 ejecutarse en un portátil?
No como modelo completo de 2,8T en una configuración práctica de producción. El repositorio ocupa unos 1,56 TB y Moonshot recomienda 64 o más aceleradores para inferencia eficiente. Pueden aparecer derivados más pequeños, pero serían artefactos distintos que requieren verificar calidad y licencia.
¿Puedo probar Kimi K3 gratis mediante la API oficial?
El centro de ayuda chino de Kimi indica que el cupón de ¥15 para nuevos usuarios no puede usarse con K3. Otros productos, promociones o terceros pueden cambiar; comprueba sus condiciones actuales.
¿Kimi K3 necesita exactamente 64 GPU?
Moonshot recomienda un supernodo con 64 o más aceleradores para inferencia eficiente, pero no lo publica como mínimo universal. La topología depende de memoria y formatos, interconexión, paralelismo, contexto, concurrencia y latencia.
¿Cuál es la forma más barata de evaluar Kimi K3?
Usa una API medida con un conjunto pequeño y representativo, reutiliza prefijos estables para la caché, limita la salida y mide el coste por tarea aceptada. Suele ser más barato que provisionar un clúster antes de conocer demanda y ajuste.
¿Cuándo debería un equipo pequeño reconsiderar el autoalojamiento?
Cuando el volumen mensual y la concurrencia sean estables, exista una oferta real de infraestructura, alguien sea responsable del serving y el acceso gestionado no satisfaga un requisito esencial. Compara coste mensual total y fiabilidad, no solo tarifas por token.
¿Empezar con EvoLink impide migrar al autoalojamiento?
No. Una API compatible genera datos de uso, caché, latencia y salida para planificar capacidad. Mantén modular el adaptador, conserva fixtures de evaluación y trata el backend de inferencia como una ruta sustituible.


