MiniMax H3(Hailuo 3)が EvoLink に登場無料10クレジットで試す
Kimi K3を動かす大規模アクセラレータクラスターとマネージドAPIゲートウェイの比較
analysis

Kimi K3をローカル実行する方法:必要スペックとコスト

EvoLink Team
EvoLink Team
Product Team
2026年7月27日
20 分

結論:Kimi K3は自社管理のインフラでローカル実行できますが、フルモデルは一般的なPC向けのローカルLLMではありません。 モデルライセンス料なしでウェイトをダウンロードできても、アクセラレータ、ストレージ、ネットワーク、エンジニアリング、継続運用には費用がかかります。

Kimi K3は非常に大規模です。Moonshotの公式モデルリポジトリは約 1.56 TB、モデル全体は 2.8兆パラメータ、1トークン当たり1040億パラメータがアクティブ です。さらにMoonshotは、効率的な推論に 64基以上のアクセラレータを備えたスーパーノード を推奨しています。ウェイトが公開されたことも、運用負荷が大きいことも事実です。
本稿では、セルフホストの手順、ライセンス境界、判断表、月次TCOの考え方を整理します。利用量が少ない、または変動する段階では、従量課金APIから始める方が通常は安くなります。 まず成功タスク当たりコストを測り、稼働率を予測できるようになってから自社運用を再評価してください。

「Kimi K3を無料でローカル実行」の正確な意味

よくある表現正確な意味残るコスト
「ウェイトは無料」Moonshotの独自ライセンスの下で、取得、利用、改変、デプロイ、ファインチューニング、配布が認められるストレージ、ダウンロード、アクセラレータ、電力、サービング、監視、人員
「ローカルで動く」対応エンジンを使い、自分で管理するインフラ上で提供できるフルモデルの「ローカル」は大規模クラスターであり、一般的なノートPCではない
「APIに無料枠がある」Kimi APIの一部新規ユーザーにはクーポンが付与される中国語版Kimiヘルプでは、15元のクーポンを Kimi K3には使用できない と明記
「オープンウェイトならAPI費用は不要」自社スタックを運用する場合、ウェイト公開元へのトークン課金は発生しない変動API費用が、固定容量と運用費用に置き換わる
したがって正確な説明は、ウェイトのダウンロードは無料でも、フルモデルのローカル実行は無料ではない ということです。セルフホストの妥当性は総保有コストで判断します。

確認済みのKimi K3デプロイ要件

以下は2026年7月27日にMoonshotおよび推論エンジンの一次情報で確認した内容です。

デプロイ項目確認済みの値計画上の意味
総パラメータ2.8T7B〜70Bのローカルモデルと同じ容量計画は使えない
アクティブパラメータ1トークン当たり104B疎な活性化は計算量を減らすが、エキスパートウェイトの保存とルーティングは必要
ウェイト/活性値形式MXFP4ウェイト、MXFP8活性値公開された量子化は効率を狙うが、対応ハードウェアとカーネルが必要
リポジトリ容量約1.56 TB、96個のウェイトシャード生データ以外にバージョン、キャッシュ、ログ、ロールバック用の余裕が必要
コンテキストウィンドウ1,048,576トークンKV/状態メモリと長文プリフィルが主要な容量変数になり得る
推奨トポロジー64基以上のアクセラレータを備えたスーパーノード効率的な本番推論向けの推奨であり、普遍的な起動最小要件ではない
対応サービングエンジンvLLM、SGLang、TokenSpeed一般的な単一GPU設定ではなく、K3向けのアップストリーム手順を使う
「64基以上を推奨」は「64 GPU未満では絶対に起動しない」という意味ではありません。世代、メモリ、インターコネクト、コンテキスト長、同時実行数、並列方式、レイテンシ目標で最小構成は変わります。それでもフルK3はクラスター案件であり、PCでワンクリック実行するローカルモデルではありません。

Kimi K3をセルフホストする手順

ソフトウェアの入口は単純でも、難しいのはインフラと本番運用です。

1. ダウンロード前にライセンスを確認する

Kimi K3 Licenseは、利用、改変、配布、ファインチューニング、デプロイ、派生物の作成を認めています。Apache 2.0やMITではなく、独自ライセンスです。

特に次の3点は法務確認が必要です。

  • ライセンス保有者と関連会社がModel-as-a-Serviceを運営し、連続する任意の12か月で合計売上が 2,000万米ドル を超える場合、商用利用前にMoonshotとの別契約が必要です。
  • K3を使う商用製品の月間アクティブユーザーが 1億人 を超える、または月間売上が 2,000万米ドル を超える場合、製品上に「Kimi K3」を目立つ形で表示する必要があります。
  • ライセンスで定義された社内利用、およびMoonshot公式製品や認定推論パートナー経由の利用には、上記2要件は適用されません。

これは判断用の要約であり、法的助言ではありません。コピーにはライセンスと著作権表示を残し、自社製品への適用は専門家に確認してください。

2. モデルファイルと転送を計画する

公式リポジトリには96個の safetensors シャードがあり、合計約1.56 TBです。容量を1.56 TBぎりぎりにせず、バージョン、ダウンロードキャッシュ、ロールバック分も確保します。
pip install -U "huggingface_hub[cli]"
huggingface-cli download moonshotai/Kimi-K3 \
  --local-dir /models/Kimi-K3

再現可能な本番ビルドのためリビジョンを固定し、チェックサムまたはマニフェストを保存します。不変のモデルファイルとサービングキャッシュを分離し、新バージョンを全ワーカーへ配布しても本番ネットワークを圧迫しない設計にしてください。

3. アップストリームで対応するエンジンを選ぶ

モデルカードはvLLM、SGLang、TokenSpeedを挙げています。現在のvLLM K3公式レシピではサポートがPre-releaseとされ、K3対応のvLLM 0.26.0+イメージが必要です。単一ノードの検証基準は少なくとも 8× GB300、AMD経路は少なくとも 8× MI355XまたはMI350X です。Moonshotの64+アクセラレータ・スーパーノード推奨は、効率的な本番推論向けであり、検証環境の一律最低条件ではありません。
重みを /models/Kimi-K3 に配置済みの場合、8 GPUのNVIDIA検証ノードではK3専用イメージを使い、並列数を明示します。
docker run --rm --gpus all --ipc=host \
  -p 8000:8000 \
  -v /models/Kimi-K3:/models/Kimi-K3:ro \
  vllm/vllm-openai:kimi-k3 \
  --model /models/Kimi-K3 \
  --tensor-parallel-size 8 \
  --trust-remote-code \
  --load-format fastsafetensors \
  --moe-backend auto \
  --gpu-memory-utilization 0.95 \
  --max-model-len 32768 \
  --reasoning-parser kimi_k3 \
  --enable-auto-tool-choice \
  --tool-call-parser kimi_k3

これは範囲を限定した検証構成であり、完全なマルチノードデプロイではありません。初期の32Kコンテキスト上限は容量の余裕を残すための設定です。メモリと並行処理を測定してから引き上げてください。本番では、トポロジー別のアップストリーム手順、テンソル/エキスパート/データ並列化、アクセラレータ固有カーネル、スケジューラー、ヘルスチェック、容量テストが引き続き必要です。

4. スループットより先に正しさを確認する

テキストと画像入力、reasoning_content、複数ターンで保持される思考、ツール呼び出し、構造化出力、長文コンテキスト、キャンセル、再試行を検証します。HTTP 200だけでは正しいデプロイとは言えません。トラフィックを移す前に、固定評価セットでマネージド経路と比較してください。

5. 本番運用に必要な仕組みを追加する

セルフホストには次も必要です。

  • ロードバランシング、流入制御、キュー、バックプレッシャー
  • 最初のトークンまでの時間、スループット、キャッシュヒット率、エラー、アクセラレータ状態の監視
  • オートスケーリング、または意図的な固定容量ポリシー
  • ローリングアップデート、アーティファクトのロールバック、サービングエンジンの更新
  • 不正利用対策、認証、レート制限、監査ログ、データ保持
  • ワーカー障害、インターコネクト問題、性能回帰、容量枯渇へのオンコール対応
本当のセルフホストコストを決めるのはクラスターと運用であり、最初の vllm serve コマンドではありません。
Kimi K3への2つの本番経路:多段のセルフホストクラスターとコンパクトなマネージドAPIが同じアプリケーションにつながる
Kimi K3への2つの本番経路:多段のセルフホストクラスターとコンパクトなマネージドAPIが同じアプリケーションにつながる

Kimi K3の月次TCOを計算する

比較では両方の式を明示します。

managed_api_cost =
  uncached_input_tokens × live_input_rate
  + cached_input_tokens × live_cache_rate
  + output_tokens × live_output_rate

self_host_monthly_tco =
  accelerator_and_infrastructure
  + engineering_and_operations
  + one_time_setup / amortization_months

インターネット上のGPU価格を実際の見積もりとして扱わないでください。必要なトポロジーで見積もりを取得し、ストレージ、ネットワーク、サポート、冗長性、稼働率、人員を含めます。

まずチームがセルフホストに適しているかを判断し、その後にコストを計算します。
状況適切な開始方法理由
個人開発者、評価、試作マネージドAPIクラスター契約なしで実測利用分だけ支払える
少量、変動、未確定トラフィックの小規模チームマネージドAPI固定インフラとオンコール費用を正当化しにくい
K3がマルチモデル製品の1経路EvoLink統合APIK3、小型モデル、フォールバックを1つの接続方法で維持できる
安定した大規模本番需要両方を計算実稼働率と実見積もり次第で自社容量が合理的になる
厳しいデータレジデンシーやウェイト変更セルフホストが候補コスト以上にインフラ管理が重要になり得る
既存の推論クラスターと運用チームセルフホストが現実的基盤と人員の固定費の多くが既に存在する

次に、現在の従量料金と比較する前に、次のセルフホスト費用をすべて集めます。

コスト領域含める項目
モデルアーティファクト1コピー当たり約1.56 TBに加え、ダウンロード、ステージング、バージョン、キャッシュ、ロールバック
推論クラスターレイテンシと同時実行目標を満たすアクセラレータ構成、ホストメモリ、CPU、高速インターコネクト。Moonshotは64基以上を推奨
ストレージとネットワーク永続ストレージ、ノード間通信、アーティファクト配布、ログ、外向き通信
エンジニアリング接続実装、分散サービング、評価、最適化、更新、障害対応
可用性予備容量、ヘルスチェック、フェイルオーバー、監視、バックアップ、オンコール
ライセンスとコンプライアンス法務確認、表示、アクセス制御、監査ログ、プライバシー、データレジデンシー
安定した利用量、実際のクラスター見積もり、推論運用の担当チームがないなら、セルフホストから始めるべきではありません。 EvoLinkの従量利用で30〜60日分の実ワークロードを集め、その後に再計算してください。
普遍的な損益分岐点は提示できません。低すぎるハードウェア価格を事前入力すると誤った答えになります。現在のマネージド費用はKimi K3モデルページで確認できます。

セルフホストが適する条件

複数の条件が同時に成立する場合は合理的です。

  • 継続需要によりクラスターを高稼働率で維持できる
  • プライバシーやデータレジデンシーのため管理下インフラが必要
  • 大規模な分散推論システムを既に運用している
  • ウェイト変更、ファインチューニング、サービングの深い改変が必要
  • 予測可能な長期利用量で構築、サポート、更新費用を償却できる
  • Kimi K3 Licenseが事業モデルに合う
既存クラスターを持つ大企業の損益分岐点は、5人のアプリケーションチームにはそのまま当てはまりません。 普遍的な計算機ではなく、実利用量と実見積もりで判断してください。

マネージドAPIの方が安くなりやすい条件

個人、スタートアップ、小規模チームには、マネージドAPIが通常は低リスクな出発点です。 特に次の場合です。
  • トラフィックが少ない、突発的、季節的、または未計測
  • 推論クラスターの運用ではなく機能の提供が目標
  • K3がマルチモデル製品の1経路にすぎない
  • ワークロードとの適合性をまだ検証中
  • 可用性、復旧、エンジン更新が希少なエンジニアリング時間を消費する
  • 大きな固定容量がモデル切り替えの柔軟性を下げる
EvoLinkでは、kimi-k3を他モデルと同じUnified API Gatewayから利用できます。K3を試し、通常タスクは小型モデルに残し、フォールバックも維持できます。K3専用の処理能力を先に購入する必要はありません。 現在の料金はKimi K3モデルページ、リクエスト、コンテキスト、ツール、移行方法はAPIガイドを参照してください。
Kimi K3 APIの最新料金を比較

セルフホストの選択肢を残す低コストな導入

インフラを初日に決めず、段階的に判断します。

  1. 従量APIから始める。 非キャッシュ入力、キャッシュ読み取り、出力、再試行、レイテンシ、タスク承認率を記録します。
  2. 選択的にルーティングする。 分類、書き換え、簡単な依頼は小型モデルに残し、大規模リポジトリやツール中心の作業をK3へ上げます。
  3. 観測需要からTCOを作る。 30〜60日分のトークンと同時実行数を容量要件に変換します。
  4. 実際のセルフホスト見積もりを取る。 アクセラレータ賃料だけでなく冗長性と運用を含めます。
  5. 管理されたサービング検証を行う。 コスト削減案件と扱う前に、品質、スループット、長文コンテキスト、障害復旧を検証します。

この順序なら、プライベートデプロイの可能性を閉じずに利用量の基準値を得られます。ベンチマークは動いても本番の同時実行とオンコールには足りないハードウェアを買う失敗も避けられます。

FAQ

Kimi K3はオープンソースですか?

MoonshotはK3を オープンウェイトモデル と呼び、コードとウェイトを独自のKimi K3 Licenseで公開しています。「オープンソース」は特定の定義への準拠を示す場合があるため、「Kimi K3 Licenseのオープンウェイト」がより正確です。

Kimi K3はノートPCで動きますか?

フル2.8Tモデルを実用的な本番構成で動かすことはできません。公式リポジトリだけで約1.56 TBあり、Moonshotは効率的な推論に64基以上のアクセラレータを推奨しています。小型のコミュニティ派生版が登場しても別のアーティファクトであり、品質とライセンスを個別に確認する必要があります。

Kimi K3を公式APIで無料試用できますか?

中国語版Kimiヘルプでは、新規APIユーザー向け15元クーポンはK3に利用できないと説明しています。他の製品、キャンペーン、第三者サービスの条件は変わる可能性があるため、最新情報を確認してください。

Kimi K3には必ず64 GPUが必要ですか?

Moonshotは効率的な推論に64基以上のアクセラレータを備えたスーパーノードを推奨していますが、普遍的な最小要件とはしていません。実構成はメモリ、フォーマット対応、インターコネクト、並列化、コンテキスト、同時実行数、レイテンシ目標で変わります。

Kimi K3を最も安く評価する方法は?

小さく代表的なタスクセットを従量APIで実行し、安定したプリフィックスのキャッシュを活用し、出力上限を適切に設定して、承認済みタスク当たりコストを測ります。需要とモデル適合性が不明な段階でクラスターを用意するより通常は安価です。

小規模チームがセルフホストを再検討するタイミングは?

月間利用量と同時実行数が安定し、実際のインフラ見積もりがあり、サービング運用の担当者が決まり、マネージドAPIでは満たせない要件があるときです。トークン単価だけでなく、月間総費用と信頼性を比較してください。

EvoLinkから始めると後のセルフホストが難しくなりますか?

いいえ。互換APIで利用量、キャッシュ、レイテンシ、出力データを集めれば容量計画に使えます。アプリケーションアダプターをモジュール化し、評価用データを保存し、サービングバックエンドを交換可能な経路として扱ってください。

参照元と更新方針

一次情報:Kimi K3モデルカードとリポジトリKimi K3 LicenseMoonshotの技術発表vLLMの本番対応プレビューKimi API無料テスト規則。ライセンス、新しい量子化、デプロイ手順、K3の提供状況が大きく変わった場合は再確認します。

AIコストを89%削減する準備はできましたか?

今すぐEvoLinkを始めて、インテリジェントなAPIルーティングの力を体験してください。