
Qwen3.8 vs Kimi K3:コーディング、Agent、コンテキスト、APIの比較
名称確認: Qwen3.8 Max PreviewとQwen3-8Bは別モデルです。旧80億パラメータモデルの料金、ベンチマーク、ローカル導入情報をQwen3.8の情報として扱わないでください。
判断早見表
| 状況 | 現時点の選択 | 理由 |
|---|---|---|
| EvoLinkで今すぐ出荷する | Kimi K3 | ルート、モデルID、料金、資料が確認できます。 |
| 最新Qwenを早期評価する | Qwen3.8 Max Preview | Token Planで推論、画像理解、テキスト生成を評価できます。 |
| APIコストを予測したい | Kimi K3 | Qwen3.8の標準トークン料金は未公開です。 |
| 安定した本番IDが必要 | Kimi K3 | QwenのPreview IDは変更・置換され得ます。 |
| Open Weightsで運用したい | 証拠を待つ | Qwenは計画を発表しただけで、成果物とライセンスは未公開です。 |
| コーディングAgentの最適モデルを選ぶ | 同条件で試験 | 公開デモでは自社リポジトリ、ツール、合格基準を代替できません。 |
2026年7月21日時点の確認済み事実
| 項目 | Qwen3.8 Max Preview | Kimi K3 | 本番への意味 |
|---|---|---|---|
| 段階 | Qwen Token Planの公式Preview | リリース済みAPIモデル | Kimiの本番経路が成熟しています。 |
| 公開ID | qwen3.8-max-preview | kimi-k3 | Qwen IDがGA後も同じとは限りません。 |
| EvoLink提供 | 未提供 | 提供中 | ライブ経路はKimi、Qwenは評価待ちです。 |
| バックエンド利用 | 個人Token Planは自動化、独自バックエンド、非対話型バッチを禁止 | 本番APIを文書化 | Previewアクセスと配備可能APIは別です。 |
| 入力能力 | 推論、画像理解、テキスト生成 | テキスト・画像・動画理解 | 入力契約と制限を別々に確認します。 |
| コンテキスト根拠 | Qwen現行モデル一覧で1M | 公式モデル資料で1,048,576 | どちらも約1Mですが、実際の検索品質は検証が必要です。 |
| 推論制御 | low、medium、xhigh、既定xhigh | 常時オン、low、high、max、既定max | 出荷可能な設定同士で比較します。 |
| 料金 | Token Plan Credits、標準単価は未文書化 | キャッシュ入力、通常入力、出力単価を公開 | 数値での単価比較は時期尚早です。 |
| ライフサイクルリスク | Previewは変更または置換される可能性あり | 本番ルートはあるが、新しい挙動は継続監視が必要 | Fallbackを保ち、モデル選択を設定化します。 |
コーディング:可能性と今試せる経路
QwenはQwen3.8をコーディング、複雑な推論、データ分析、専門業務の大幅な前進と位置づけています。大きな推論Budgetも確認でき、リポジトリ探索、複数ファイル実装、長期計画の候補になります。
Kimi K3の実務上の強みは、EvoLink経由で同じ作業を実行し、利用量、レイテンシ、失敗、コストを今日測れることです。次の試験を同じ入力と判定基準で実施してください。
| 試験 | 合格条件 | 測れる能力 |
|---|---|---|
| 既存リポジトリのバグ修正 | 原因を修正し、テスト合格、不要変更なし | 診断と変更規律 |
| 複数モジュール機能 | Interface整合、移行完了、Rollback可能 | 依存関係をまたぐ計画 |
| Code Review | 埋め込んだ欠陥を発見し有効な修正を提示 | 判断力 |
| UI実装 | 視覚品質、レスポンシブ、Accessibility、保守性 | 画像理解と実装品質 |
| 長時間ツール作業 | 正しい呼び出し、失敗復旧、ループなし | Agent信頼性 |
Token Planの高機能クライアントと、素のKimi API呼び出しを比べて差をすべてモデル由来としないでください。クライアント、ツール、コンテキスト準備、推論設定、Retry方針を記録します。
Agent:ハーネスが結果を変える
QwenのToken PlanにはWeb検索、コードインタープリター、Web抽出などの組み込みツールがあります。KimiはTool Callingを文書化し、長い推論ループで状態を正しく保持する必要があります。これは同一環境ではありません。
| Agentレイヤー | 固定する条件 | 失敗シグナル |
|---|---|---|
| 目標とPrompt | 同じタスク、制約、ファイル、完了定義 | 一方だけ明確なBriefを受ける |
| Tool権限 | 同じToolと破壊的操作の制限 | Tool差をモデル能力と誤認する |
| State | 必要なAssistant・推論・Tool履歴を保持 | ループまたは過去判断の消失 |
| 時間とBudget | 同じTimeoutと合格タスクBudget | 完了まで無制限に消費する |
| Reviewer Rubric | 同じ合否・Severity定義 | 評価が好みに変わる |
測るべき指標は、無介入完了率、無効なTool Call、失敗からの復旧、ループ、介入回数、合格までの時間、欠陥率です。「完了した」だけでは、レビュー担当者の修復コストを隠します。

コンテキスト:上限は入口にすぎない
Kimiは1,048,576トークン、Qwenの現行モデル一覧はToken Plan Previewに1Mトークンを文書化しています。同じ公称サイズでも検索品質や将来のEvoLinkルート制限が同じとは限りません。
64K、256K、512K、実運用最大値の順で試します。既知の根拠を異なる位置に置き、引用を要求し、検索精度、長期指示保持、矛盾、キャッシュ効率を分けて採点します。上限が大きくても通常の入力長で精度が落ちれば価値はありません。
マルチモーダル:入力とGroundingを確認
Qwenは画像理解、Kimiはテキスト・画像・動画入力を文書化しています。UIレビュー、文書解析、グラフ抽出などは重なりますが、契約が同一とは限りません。同じ素材を使い、OCRと推論を分け、視覚根拠を要求し、見落としと捏造を別々に記録します。
Qwen3.8の形式、容量、動画入力、EvoLink上のMedia Pathは、ルート資料が出るまで断定しません。
API準備度:能力ではなく証拠でKimiが先行
| Gate | Qwen3.8 Max Preview | Kimi K3 |
|---|---|---|
| 安定したEvoLinkルート | 保留 | 確認済み |
| EvoLinkモデルID | 保留 | 確認済み |
| EvoLink料金 | 保留 | モデルページで公開 |
| 本番用サンプル | 保留 | ドキュメントあり |
| Rate・地域挙動 | 将来のルートで要検証 | 現在のアカウントと資料で確認 |
| Fallback試験 | EvoLinkでは未実施 | 今すぐ実施可能 |
これはKimiが常に高性能という証明ではありません。予算化、統合、監視、Rollbackが現在可能だという意味です。
コスト:宣伝Creditsではなく成功タスクを比較
Qwen3.8はToken Plan Creditsで提供され、期間限定倍率があり得ます。標準トークン単価に変換すると誤った精度になります。ルート公開後は次を使います。
accepted_task_cost = input + cached_input + output + tools + retries + fallback + reviewer_time推奨ルーティング方針
| 役割 | 現在の候補 | 昇格条件 |
|---|---|---|
| 本番の長文・マルチモーダル | Kimi K3 | 合格率、信頼性、コストが基準内 |
| 次世代Qwen評価 | EvoLink外のQwen3.8 Preview | 顧客依存なしで制限を記録 |
| 将来の挑戦ルート | EvoLinkで有効化後のQwen3.8 | 同条件試験とルート検証を通過 |
| Provider Fallback | ClaudeやGPTなど対応モデル | 障害・Rollback試験済み |
| コスト重視の定型作業 | 対応する小型モデル | Frontierの価値が測れる作業だけ昇格 |
Qwen固有機能やOpen Weights方針が重要なら待つ価値があります。一方、安定IDと課金が必要、PreviewのRollbackを運用できない、客への提供約束がQwenの日程に依存する場合は待たずに対応モデルで出荷してください。
Qwen3.8を待つべきケース
Qwenへの標準化が重要で、移行を可逆に保てる場合は待つ価値があります。ただしQwen3.8のAPIテストは本番利用可能なルート公開後に行い、それまではKimi K3を実運用Baselineにします。
よくある質問
Qwen3.8はKimi K3より優れていますか?
断定できる比較証拠はまだ不足しています。両者を同じ出荷環境、同じ作業、同じ判定基準で試してください。
今コーディングに使うならどちらですか?
EvoLinkの利用可能な本番ルートが必要ならKimi K3です。変更を許容できる場合はQwenのPreviewを別環境で評価します。
コンテキストが大きいのはどちらですか?
Kimiは1,048,576、Qwenは現在のToken Plan Previewで1Mを公開しています。実質的に同規模ですが、検索品質が同じとは結論できません。
安いのはどちらですか?
Kimiにはトークン料金があります。Qwen3.8はCredits方式で、現時点では公平な単価比較ができません。
両方マルチモーダルですか?
Kimiはテキスト・画像・動画、Qwen Previewは画像理解を文書化しています。実際の形式と制限は各ルートで確認します。
Qwen3.8はEvoLinkで使えますか?
Qwen3.8公開後にKimi K3から移行すべきですか?
自動的には移行しません。本番可能なRouteで同一Taskを比較し、品質、Latency、Retry、Cache、成功タスク単価が改善する場合だけ限定Canaryへ進みます。
Agentの信頼性はどう比較しますか?
無介入完了率、Tool Call妥当性、失敗復旧、ループ、介入回数、合格までの時間、欠陥率を同じ権限とBudgetで測ります。
出典
- Qwen Token Plan個人向け概要
- Qwen組み込みツール
- Qwen Chat API
- Qwen Kilo CLI設定
- Kimi K3概要
- Kimi K3料金
- Kimiモデル仕様
- Kimi Tool Callingガイド


