
Qwen3.8ベンチマーク:確認済みの結果と今後の検証項目
名称確認: Qwen3.8 Max PreviewとQwen3-8Bは別モデルです。旧8BモデルのScoreはQwen3.8の証拠になりません。
このページは確認済み事実と限界を整理できますが、Qwen3.8がFable 5、GPT-5.6、Kimi K3、Qwen3.7 Maxを総合的に上回るとは結論できません。
現在の証拠レベル
| 証拠 | 現状 | 判断できること | 判断できないこと |
|---|---|---|---|
| 公式ステータスと機能 | あり | Preview ID、チャネル、推論・画像・テキスト分類 | 総合順位 |
| QwenのLaunch Positioning | あり | 仮説と比較対象 | 独立した勝者宣言 |
| 第三者ワークロード試験 | 限定的 | 特定タスクとルートでの観察 | 一般能力と安定平均 |
| 広範な独立Benchmark | 不十分 | 将来の横断比較 | 現時点の決定的Leaderboard |
文書化された機能はPerformance Scoreではなく、Vendor順位は独立証拠ではありません。この二つを「確認済みBenchmark」として混ぜないでください。
Qwenが公式に主張していること
Qwenは総2.4兆パラメータ、継続的改善、Open Weights計画、最先端に近い内部評価を発表しています。これらは試験仮説になります。
| 発表 | 有効な仮説 | 危険な結論 |
|---|---|---|
| 総2.4兆パラメータ | 難しい作業でScaleの効果を試す | 大きいほど必ず優れる |
| Frontierに近い内部評価 | Fable、GPT、Kimi、Qwen3.7を比較対象にする | 独立評価で世界2位 |
| コーディング・複雑作業 | リポジトリと長いTool Loopを試す | 最高のCoding Model |
| Open Weights計画 | Servingと再現性の質問を準備する | 公開WeightがHosted Previewと同一 |
有効パラメータ数とArchitectureが未公開なら、総パラメータだけで推論コスト、速度、メモリ、1トークン当たり計算量は判断できません。
初期の第三者試験から分かること
Trilogy AIの初期テストは269ファイルのリポジトリアーキテクチャ課題でQwen3.8 Max PreviewとKimi K3を比較し、Blind ReviewでKimi 83、Qwen 80と評価しました。Qwenはシステム境界とReplay Metadataの一部で優れ、Kimiはより速く少ないトークンで完了し、Lifecycle Stateを広く扱いました。
この結果は作業構造、エラー、トークン、質的差を報告している点で有用です。しかし、1課題、各モデル1セッション、特定Routeの結果であり、一般的なランキングではありません。
方法論として採用すべき点は次です。
- 入力を固定して比較する。
- 出力構造だけでなく主張の正確性も採点する。
- Model BehaviorとRoute Behaviorを分離する。
- 品質とともにLatencyとTokenを報告する。
- 可能ならReviewerをBlindにする。
- 合計点だけでなくFailure Analysisを公開する。
Qwen側は対話型Coding HarnessのToken Plan経路でした。個人プランは独自バックエンド、自動スクリプト、非対話型バッチを禁止します。83対80は特定日時のEnd-to-End評価経路比較であり、交換可能な二つの本番API比較ではありません。
まだ不足している証拠
完全な公式Benchmark開示
モデル版、推論設定、Tool Access、Prompt Policy、試行回数、採点方法、競合設定が必要です。HarnessのないScoreは再現困難です。
独立したCoding・Agent再現
関数生成だけでなく、リポジトリ探索、複数ファイル変更、テスト、Tool Call、失敗復旧、レビューを含めます。
マルチモーダル証拠
OCR、Visual Grounding、文書理解、Chart Reasoning、Samplingした動画Frame、Hallucinationを分離します。Native Video入力はまだ仮定しません。
LatencyとToken効率
高得点でも長い推論、高い出力量、予測不能なLatencyで製品体験と費用が悪化することがあります。
Route安定性と利用権限
正確なID、日付、チャネル、地域、Client、設定に加え、Interactive Evaluation、自動Regression、Application Backend、Batchの許可範囲を記録します。

再現可能な利用権限
対話型購読で実行できることと、アプリBackendや自動回帰Testで許可されることを分けて記録します。Routeの利用条件は品質Scoreと別のGateです。
公開Benchmarkが本番判断に失敗する理由
| Blind Spot | 隠れる本番障害 | より良い測定 |
|---|---|---|
| One-shot回答 | 計画は正しいが実装が壊れる | End-to-End合格タスク |
| 理想Prompt | 実ユーザー入力で脆い | Prompt Variation合格率 |
| Tool障害なし | 悪いTool Call後にループ | 障害注入からの復旧 |
| 1回の試行 | 高Variance | 複数試行と信頼区間 |
| Token単価のみ | 安いがRetry多数 | 成功タスク単価 |
| 最大Context | 長文から根拠を探せない | 位置制御したRecall |
| 最終回答点のみ | 美文にUnsupported Claimが隠れる | Claim単位のEvidence Audit |
将来のEvoLink Qwen3.8 Benchmark Gate
このProtocolは本番利用可能なAPI Routeが公開された後にのみ実行します。公開済みTest結果でも、大規模Token Plan試験に今すぐ支出する理由でもありません。
1. 作業セットを固定する
API公開後は小規模Pilotから始め、結果とRoute条件が妥当な場合だけ拡張します。Qwen3.7 Max、Kimi K3、Claude、GPTなど現行RouteをBaselineにします。
| Category | 最小試験 | 合格Signal |
|---|---|---|
| Repository Coding | Bug Fixと複数Module機能 | テスト合格、不要変更なし |
| Coding Agent | 複数Toolの長時間作業 | 正しいCall、未解決Loopなし |
| Reasoning | 多段Technical Decision | 正答と追跡可能な前提 |
| Long Context | 文書・Repo検索 | 正しい根拠と引用 |
| Vision | Screenshot、Chart、Document | Grounded Extraction、低捏造率 |
| Data Work | 表分析とReport | 数値正確性、使用可能な成果物 |
| Routine Workload | 小さな一般タスク | Frontier Routeが測定可能な価値を追加 |
2. 環境を固定する
正確なModel ID、日付、Provider Route、地域、System/User Prompt、推論設定、Tool権限、Timeout、Retry、Fallback、Token、Cache Hitを記録します。
3. StyleよりAcceptanceを先に採点する
テスト、Schema、引用、数値、必須成果物を先に判定し、その後で保守性、明瞭さ、好みを評価します。
production_score = acceptance_rate
- severe_defect_rate
- intervention_penalty
- timeout_penalty4. 成功タスクの経済性を計算する
accepted_task_cost = model_calls + retries + fallback_calls + reviewer_time + repairQwen3.8の標準トークン料金は未公開です。CreditsはPreview実験の消費として記録できますが、一般API料金として比較しません。
5. 万能順位ではなくRoute Roleを決める
| 役割 | 必要な証拠 |
|---|---|
| Default Route | 一般トラフィックで安定した品質、速度、費用 |
| Coding Specialist | RepoとTool作業で明確な優位 |
| Long-context Specialist | 実際の長さで高いRecallと一貫性 |
| Quality Escalation | 難しい作業で高い合格率 |
| Evaluation Only | 能力は高いがID、費用、挙動が不安定 |
Evaluation Onlyが正しい現在地です。新しいScoreを読む8つの質問
- 公開者はVendor、比較対象、独立評価者のどれか。
- 正確なQwen3.8 BuildとRouteは何か。
- 推論は有効か、Effortはいくつか。
- Tool、Browsing、Code Executionは使えるか。
- 試行回数はいくつか。
- Promptと採点は再現できるか。
- 自社製品の作業を測っているか。
- Latency、Token、Retry、Failureを含むか。
欠けていれば方向性の証拠とLabelし、Winner表に入れません。
EvoLinkユーザーへの推奨
よくある質問
Qwen3.8のベンチマークスコアは?
信頼できる単一の総合点はありません。VendorのPositioningはありますが、完全な表と広範な独立再現が不足しています。
Fable 5に次ぐ2位ですか?
Qwenによる位置づけであり、独立検証された普遍的順位ではありません。
第三者評価はありますか?
269ファイルのリポジトリ比較など初期試験はありますが、総合順位を決めるには狭すぎます。
コーディングに強いですか?
主要ユースケースですが、本番ではRepo変更、Tool、復旧、テスト、Reviewまで評価します。
Kimi K3とどう比較しますか?
入力、権限、判定基準、Budgetを固定し、複数回実行して品質、Latency、Token、介入、コストを別々に測ります。
Token Plan Creditsを費用比較に使えますか?
Preview実験の消費は表せますが、標準API単価へ変換して他社のトークン料金と直接比較すべきではありません。
どのBaselineを含めるべきですか?
実際に置き換える可能性があるQwen3.7 MaxやKimi K3に加え、品質上限を測るFable 5やGPT-5.6などを含めます。利用できないモデルを飾りの比較対象にしないでください。
本番準備ができるのはいつですか?
安定Route、ID、料金、制限、利用規約が公開され、実ワークロードで品質、信頼性、Latency、コストのGateを通過した時です。


