Kimi K3 の提供を開始しましたKimi K3 を見る
Qwen3.8のコーディング、推論、画像理解、Agentを評価する抽象的な証拠ラボ
benchmark

Qwen3.8ベンチマーク:確認済みの結果と今後の検証項目

Jessie
Jessie
COO
2026年7月21日
14 分
要点: 完全で再現可能なQwen3.8 Scorecardはまだありません。公式の完全表と広範な独立再現が不足しています。EvoLinkは本番Routeが存在しないため、独自のQwen3.8 API Benchmarkを実行していません。
正しい問いは「何位か」ではなく、「どの証拠なら本番ルーティングを変更できるか」です。Qwen3.8 MaxページはEvoLinkの提供状況を追跡し、本稿は実トラフィックを与える前の評価Gateを定義します。
名称確認: Qwen3.8 Max PreviewとQwen3-8Bは別モデルです。旧8BモデルのScoreはQwen3.8の証拠になりません。

このページは確認済み事実と限界を整理できますが、Qwen3.8がFable 5、GPT-5.6、Kimi K3、Qwen3.7 Maxを総合的に上回るとは結論できません。

現在の証拠レベル

証拠現状判断できること判断できないこと
公式ステータスと機能ありPreview ID、チャネル、推論・画像・テキスト分類総合順位
QwenのLaunch Positioningあり仮説と比較対象独立した勝者宣言
第三者ワークロード試験限定的特定タスクとルートでの観察一般能力と安定平均
広範な独立Benchmark不十分将来の横断比較現時点の決定的Leaderboard

文書化された機能はPerformance Scoreではなく、Vendor順位は独立証拠ではありません。この二つを「確認済みBenchmark」として混ぜないでください。

Qwenが公式に主張していること

Qwenは総2.4兆パラメータ、継続的改善、Open Weights計画、最先端に近い内部評価を発表しています。これらは試験仮説になります。

発表有効な仮説危険な結論
総2.4兆パラメータ難しい作業でScaleの効果を試す大きいほど必ず優れる
Frontierに近い内部評価Fable、GPT、Kimi、Qwen3.7を比較対象にする独立評価で世界2位
コーディング・複雑作業リポジトリと長いTool Loopを試す最高のCoding Model
Open Weights計画Servingと再現性の質問を準備する公開WeightがHosted Previewと同一

有効パラメータ数とArchitectureが未公開なら、総パラメータだけで推論コスト、速度、メモリ、1トークン当たり計算量は判断できません。

初期の第三者試験から分かること

Trilogy AIの初期テストは269ファイルのリポジトリアーキテクチャ課題でQwen3.8 Max PreviewとKimi K3を比較し、Blind ReviewでKimi 83、Qwen 80と評価しました。Qwenはシステム境界とReplay Metadataの一部で優れ、Kimiはより速く少ないトークンで完了し、Lifecycle Stateを広く扱いました。

この結果は作業構造、エラー、トークン、質的差を報告している点で有用です。しかし、1課題、各モデル1セッション、特定Routeの結果であり、一般的なランキングではありません。

方法論として採用すべき点は次です。

  • 入力を固定して比較する。
  • 出力構造だけでなく主張の正確性も採点する。
  • Model BehaviorとRoute Behaviorを分離する。
  • 品質とともにLatencyとTokenを報告する。
  • 可能ならReviewerをBlindにする。
  • 合計点だけでなくFailure Analysisを公開する。

Qwen側は対話型Coding HarnessのToken Plan経路でした。個人プランは独自バックエンド、自動スクリプト、非対話型バッチを禁止します。83対80は特定日時のEnd-to-End評価経路比較であり、交換可能な二つの本番API比較ではありません。

まだ不足している証拠

完全な公式Benchmark開示

モデル版、推論設定、Tool Access、Prompt Policy、試行回数、採点方法、競合設定が必要です。HarnessのないScoreは再現困難です。

独立したCoding・Agent再現

関数生成だけでなく、リポジトリ探索、複数ファイル変更、テスト、Tool Call、失敗復旧、レビューを含めます。

マルチモーダル証拠

OCR、Visual Grounding、文書理解、Chart Reasoning、Samplingした動画Frame、Hallucinationを分離します。Native Video入力はまだ仮定しません。

LatencyとToken効率

高得点でも長い推論、高い出力量、予測不能なLatencyで製品体験と費用が悪化することがあります。

Route安定性と利用権限

正確なID、日付、チャネル、地域、Client、設定に加え、Interactive Evaluation、自動Regression、Application Backend、Batchの許可範囲を記録します。

公式事実から第三者ワークロード、本番合格基準までを示すQwen3.8ベンチマーク証拠ラダー
公式事実から第三者ワークロード、本番合格基準までを示すQwen3.8ベンチマーク証拠ラダー

再現可能な利用権限

対話型購読で実行できることと、アプリBackendや自動回帰Testで許可されることを分けて記録します。Routeの利用条件は品質Scoreと別のGateです。

公開Benchmarkが本番判断に失敗する理由

Blind Spot隠れる本番障害より良い測定
One-shot回答計画は正しいが実装が壊れるEnd-to-End合格タスク
理想Prompt実ユーザー入力で脆いPrompt Variation合格率
Tool障害なし悪いTool Call後にループ障害注入からの復旧
1回の試行高Variance複数試行と信頼区間
Token単価のみ安いがRetry多数成功タスク単価
最大Context長文から根拠を探せない位置制御したRecall
最終回答点のみ美文にUnsupported Claimが隠れるClaim単位のEvidence Audit

このProtocolは本番利用可能なAPI Routeが公開された後にのみ実行します。公開済みTest結果でも、大規模Token Plan試験に今すぐ支出する理由でもありません。

1. 作業セットを固定する

API公開後は小規模Pilotから始め、結果とRoute条件が妥当な場合だけ拡張します。Qwen3.7 Max、Kimi K3、Claude、GPTなど現行RouteをBaselineにします。

Category最小試験合格Signal
Repository CodingBug Fixと複数Module機能テスト合格、不要変更なし
Coding Agent複数Toolの長時間作業正しいCall、未解決Loopなし
Reasoning多段Technical Decision正答と追跡可能な前提
Long Context文書・Repo検索正しい根拠と引用
VisionScreenshot、Chart、DocumentGrounded Extraction、低捏造率
Data Work表分析とReport数値正確性、使用可能な成果物
Routine Workload小さな一般タスクFrontier Routeが測定可能な価値を追加

2. 環境を固定する

正確なModel ID、日付、Provider Route、地域、System/User Prompt、推論設定、Tool権限、Timeout、Retry、Fallback、Token、Cache Hitを記録します。

3. StyleよりAcceptanceを先に採点する

テスト、Schema、引用、数値、必須成果物を先に判定し、その後で保守性、明瞭さ、好みを評価します。

production_score = acceptance_rate
                 - severe_defect_rate
                 - intervention_penalty
                 - timeout_penalty

4. 成功タスクの経済性を計算する

accepted_task_cost = model_calls + retries + fallback_calls + reviewer_time + repair

Qwen3.8の標準トークン料金は未公開です。CreditsはPreview実験の消費として記録できますが、一般API料金として比較しません。

5. 万能順位ではなくRoute Roleを決める

役割必要な証拠
Default Route一般トラフィックで安定した品質、速度、費用
Coding SpecialistRepoとTool作業で明確な優位
Long-context Specialist実際の長さで高いRecallと一貫性
Quality Escalation難しい作業で高い合格率
Evaluation Only能力は高いがID、費用、挙動が不安定
EvoLinkがQwen3.8ルートを有効化し検証するまでは、Evaluation Onlyが正しい現在地です。

新しいScoreを読む8つの質問

  1. 公開者はVendor、比較対象、独立評価者のどれか。
  2. 正確なQwen3.8 BuildとRouteは何か。
  3. 推論は有効か、Effortはいくつか。
  4. Tool、Browsing、Code Executionは使えるか。
  5. 試行回数はいくつか。
  6. Promptと採点は再現できるか。
  7. 自社製品の作業を測っているか。
  8. Latency、Token、Retry、Failureを含むか。

欠けていれば方向性の証拠とLabelし、Winner表に入れません。

EvoLinkユーザーへの推奨

機能と提供状況ガイドで事実境界を確認し、Qwen3.8 vs Kimi K3で利用可能な競合と比較し、Qwen3.8 vs Qwen3.7 Maxで移行Replayを準備します。Qwen3.8先行アクセスに登録し、対応モデル上で先にHarnessを作ってください。

よくある質問

Qwen3.8のベンチマークスコアは?

信頼できる単一の総合点はありません。VendorのPositioningはありますが、完全な表と広範な独立再現が不足しています。

Fable 5に次ぐ2位ですか?

Qwenによる位置づけであり、独立検証された普遍的順位ではありません。

第三者評価はありますか?

269ファイルのリポジトリ比較など初期試験はありますが、総合順位を決めるには狭すぎます。

コーディングに強いですか?

主要ユースケースですが、本番ではRepo変更、Tool、復旧、テスト、Reviewまで評価します。

Kimi K3とどう比較しますか?

入力、権限、判定基準、Budgetを固定し、複数回実行して品質、Latency、Token、介入、コストを別々に測ります。

Token Plan Creditsを費用比較に使えますか?

Preview実験の消費は表せますが、標準API単価へ変換して他社のトークン料金と直接比較すべきではありません。

どのBaselineを含めるべきですか?

実際に置き換える可能性があるQwen3.7 MaxやKimi K3に加え、品質上限を測るFable 5やGPT-5.6などを含めます。利用できないモデルを飾りの比較対象にしないでください。

本番準備ができるのはいつですか?

安定Route、ID、料金、制限、利用規約が公開され、実ワークロードで品質、信頼性、Latency、コストのGateを通過した時です。

出典

本稿は2026年7月21日時点の公開資料に基づきます。新しいScoreはHarnessとRouteを確認してから判断してください。

AIコストを89%削減する準備はできましたか?

今すぐEvoLinkを始めて、インテリジェントなAPIルーティングの力を体験してください。