
Qwen3.8 Max 벤치마크: 공식 결과와 프로덕션 근거
근거 매트릭스
| 영역 | Qwen 결과 | 한계 |
|---|---|---|
| 코딩 | Terminal 86.6 / SWE-Pro 67.7 | Harness와 저장소 수정을 분리 |
| 에이전트 | Toolathlon 72.5 | 도구 성공, 재시도, 개입 측정 |
| 추론 | HLE 43.6 / PaperBench 93.0 | 보편 순위로 변환 금지 |
| 멀티모달 | OmniDocBench 92.1 | EvoLink 미디어 경로 미검증 |
| EvoLink | Route Live, Evidence Run 미실시 | 20–50개 작업에서 성공률, Latency, Retry, Correction, Cost 측정 |
초기 제3자 테스트가 알려 주는 것
Trilogy AI의 초기 Repository Architecture Test는 269개 파일에서 Qwen3.8 Max Preview와 Kimi K3를 비교했습니다. Blind Review 점수는 Kimi 83, Qwen 80이었습니다. Qwen은 일부 System Boundary와 Replay Metadata 결정에서 강했고, Kimi는 더 빠르고 적은 Token으로 완료하며 Lifecycle State를 더 폭넓게 다뤘습니다.
Task 구조, 오류, Token 및 질적 차이를 보고했다는 점에서 유용하지만, 하나의 Task, 모델당 한 Session, 특정 Serving Route에 한정돼 일반 Benchmark는 아닙니다.
방법론상 중요한 교훈은 다음과 같습니다.
- 고정된 입력으로 비교합니다.
- 산출물 구조뿐 아니라 Claim의 정확성도 평가합니다.
- Model Behavior와 Route Behavior를 분리합니다.
- 품질과 함께 Latency와 Token을 공개합니다.
- 가능하면 Reviewer를 Blind 처리합니다.
- 총점뿐 아니라 Failure Analysis를 남깁니다.
Qwen 실행은 대화형 Coding Harness의 Token Plan Endpoint를 사용했습니다. 개인 Plan은 Custom Backend, 자동 Script, 비대화형 Batch를 금지합니다. 따라서 83 대 80은 특정 날짜의 End-to-End 평가 경로 비교이지 교환 가능한 두 프로덕션 API 비교가 아닙니다.
아직 부족한 Qwen3.8 증거
완전한 공식 Benchmark 공개
Model Version, Reasoning 설정, Tool Access, Prompt Policy, Trial 수, 채점 방법, 경쟁 모델 설정이 필요합니다. Harness가 없는 Score는 재현하기 어렵습니다.
독립 Coding 및 Agent 재현
함수 생성만이 아니라 Repository 탐색, 다중 파일 변경, Test, Tool Call, 실패 복구 및 Review를 포함해야 합니다.
멀티모달 Task 증거
OCR, Visual Grounding, 문서 이해, Chart Reasoning, Sampling한 Video Frame, Hallucination을 분리해야 합니다. Native Video Input은 아직 가정하지 않습니다.
Latency와 Token 효율
점수가 높아도 긴 추론, 큰 출력, 불안정한 Latency로 제품 경험과 비용이 악화될 수 있습니다.
Route 안정성과 이용 권한
정확한 ID, 날짜, 채널, 지역, Client, 설정을 기록합니다. Interactive Evaluation, 자동 Regression, Application Backend, Batch 사용 권한도 별도 확인합니다.

재현 가능한 이용 권한
대화형 구독에서 가능한 작업과 앱 Backend 또는 자동 회귀 Test에서 허용되는 작업을 구분해 기록합니다. Route 이용 조건은 품질 Score와 별도의 Gate입니다.
공개 Benchmark가 프로덕션 팀을 오도하는 이유
| Blind Spot | 숨겨지는 장애 | 더 나은 측정 |
|---|---|---|
| One-shot 품질 | 계획은 맞지만 구현이 깨짐 | End-to-End 합격 Task |
| 이상적 Prompt | 실제 사용자 입력에서 취약 | Prompt Variation 합격률 |
| Tool 실패 없음 | 나쁜 Call 후 Agent Loop | 실패 주입 복구 |
| 단일 Run | 높은 분산 | 다회 Trial과 신뢰 범위 |
| Token 가격만 | 싸지만 Retry가 많음 | 성공 작업 비용 |
| 최대 Context | 긴 입력에서 근거를 못 찾음 | 위치 통제 Evidence Recall |
| 최종 답변 Score | 매끄러운 글에 Unsupported Claim 은폐 | Claim 단위 Evidence Audit |
향후 EvoLink Qwen3.8 Benchmark Gate
이 Protocol은 프로덕션 적격 API Route가 공개된 뒤에만 실행합니다. 공개된 Test 결과도 아니며 지금 대규모 Token Plan 시험에 지출할 이유도 아닙니다.
1. Task Set 고정
API 공개 후 소규모 Pilot으로 시작하고 결과와 Route 조건이 타당할 때만 확대합니다. Qwen3.7 Max, Kimi K3, Claude, GPT 등 현재 Route를 Baseline으로 둡니다.
| Category | 최소 Test | 합격 Signal |
|---|---|---|
| Repository Coding | Bug Fix와 Cross-module Feature | Test 통과, 무관한 변경 없음 |
| Coding Agent | 여러 Tool을 쓰는 긴 Task | 올바른 Call, 미해결 Loop 없음 |
| Reasoning | 다단계 기술 결정 | 정답과 추적 가능한 가정 |
| Long Context | Repo 또는 문서 검색 | 정확한 근거와 인용 |
| Vision | Screenshot, Chart, Document | Grounded Extraction, 낮은 조작률 |
| Data Work | 표 분석 및 Report | 수치 정확성과 사용 가능한 산출물 |
| Routine Workload | 작고 일반적인 Task | Frontier Route가 측정 가능한 가치를 추가 |
2. 환경 고정
Model ID, 날짜, Provider Route, 지역, System/User Prompt, Reasoning, Tool 권한, Timeout, Retry, Fallback, Input/Output Token, Cache Hit를 기록합니다.
3. Style보다 Acceptance 우선
Test, Schema, 인용, 숫자 및 필수 산출물을 먼저 판정하고 유지보수성, 명확성, 선호도를 다음에 평가합니다.
production_score = acceptance_rate
- severe_defect_rate
- intervention_penalty
- timeout_penalty4. 성공 작업 경제성 계산
accepted_task_cost = model_calls + retries + fallback_calls + reviewer_time + repairQwenCloud upstream Token 가격은 공개됐지만 EvoLink Route 가격은 미정입니다. 같은 채널의 실제 청구와 성공 작업 비용을 사용하고 Preview Credits는 이력으로만 다루세요.
5. 보편 순위가 아니라 Route 역할 결정
| 역할 | 필요한 증거 |
|---|---|
| Default Route | 일반 Traffic에서 안정된 품질, Latency, 비용 |
| Coding Specialist | Repo와 Tool Task의 명확한 우위 |
| Long-context Specialist | 실제 길이에서 더 높은 Recall과 일관성 |
| Quality Escalation | 어렵고 실패 비용이 큰 Task의 높은 합격률 |
| Evaluation Only | 강한 능력이나 ID, 비용, 동작이 불안정 |
Evaluation Only가 올바른 현재 역할입니다.새로운 Score를 읽는 8가지 질문
- 발표자는 Vendor, 비교 대상 또는 독립 평가자 중 누구인가?
- 정확한 Qwen3.8 Build와 Route는 무엇인가?
- Reasoning을 켰고 Effort는 무엇인가?
- Tool, Browsing, Code Execution을 쓸 수 있었나?
- Trial은 몇 번인가?
- Prompt와 채점이 재현 가능한가?
- 우리 제품의 실제 Task를 측정하는가?
- Latency, Token, Retry, Failure를 포함하는가?
이 정보가 없으면 방향성 증거로 표시하고 Winner 표에 넣지 않습니다.
EvoLink 사용자 권장 사항
모든 점수 뒤에 재현 가능한 증거를 남긴다
Model ID, Route, 날짜, Region, Client, Thinking 설정, Tool 권한, Cache, Prompt Hash, 실행 수, Judge, Acceptance Rule을 저장하세요. 없으면 Model Revision이나 Route 변경을 성능 향상으로 오해할 수 있습니다.
| 결과 | 최소 Artifact | 허용되는 판단 |
|---|---|---|
| Qwen 공식 | 표와 Harness 설정 | Hypothesis와 Baseline |
| 제3자 | Prompt, Route, 반복, Judge, 실패 | 방향성 비교 |
| Community | 재현 Task 또는 1차 증거 | Edge Case 추가만 가능 |
| EvoLink Smoke | Request/Response, Usage, Latency, Error | Route 계약 확인 |
| EvoLink Workload | 반복 Acceptance와 Review | Main/Challenger/Fallback |
평균뿐 아니라 실패 분포를 보고하세요. 잘못된 Tool Call, 깨진 JSON, Timeout, Retry, Fallback, 사람 수정을 분모에서 빼면 안 됩니다. 4회 성공 후 1회 무한 Loop가 나는 모델은 점수가 조금 낮아도 안정적인 모델보다 운영 가치가 낮을 수 있습니다.
평가 Package를 버전 관리한다
Prompt, Fixture, Raw Response, Tool Log, Usage, 청구, Judge Rule, 사람 결정을 날짜와 함께 보관하세요. Model, Client, Route, Region 또는 Thinking 설정이 바뀌면 이전 결과를 덮어쓰지 말고 새 Run으로 기록합니다. 성공 사례뿐 아니라 Unsupported Media, Schema Repair, Timeout, 429/5xx, Fallback과 Reviewer 수정도 Failure Taxonomy에 포함해야 합니다.
벤치마크를 라우팅 결정으로 전환하기
출시 소식만 보고 바로 가입하지 마세요. 다섯 항목을 먼저 확인하고 워크로드에 맞을 때만 API 키를 만드세요.
- 01
출시됐나요?
예. Qwen3.8 Max가 정식 모델이며 Preview는 과거 채널 정보입니다.
- 02
사용할 수 있나요?
EvoLink에서 사용할 수 있습니다. 제품 페이지에서 활성 라우트와 모델 ID를 확인하세요.
- 03
내 작업에 맞나요?
긴 컨텍스트 추론, 대규모 저장소, 도구 중심 Agent에 적합하며 단순 작업은 더 작은 라우트에 유지합니다.
- 04
가격은 얼마인가요?
제품 페이지의 실시간 가격을 확인하고 upstream 또는 Preview 요금을 재사용하지 마세요.
- 05
어떻게 호출하나요?
Chat Completions, Responses, Messages 중 하나를 선택하고 연동 가이드와 파라미터 문서를 확인하세요.
다섯 항목을 모두 확인했나요? API 키 만들기.
자주 묻는 질문
Qwen3.8 벤치마크 점수는 무엇인가요?
신뢰할 수 있는 단일 종합 점수는 없습니다. Qwen은 Terminal-Bench 2.1 86.6, SWE-bench Pro 67.7, HLE 43.6, OmniDocBench 1.5 92.1을 공개했지만 Vendor 결과이지 보편 순위가 아닙니다.
Fable 5 다음으로 2위인가요?
Qwen 자체 평가에 대한 Vendor 해석이며 독립 검증된 보편 순위가 아닙니다. Workload별 Route 역할을 정하세요.
독립 테스트가 있나요?
269개 파일 Repository 비교 같은 초기 테스트가 있지만 종합 순위를 정하기에는 범위가 좁습니다.
코딩에 좋은가요?
주요 출시 Use Case이지만 프로덕션에서는 Repo 변경, Tool, Recovery, Test, Review까지 검증해야 합니다.
Kimi K3와 어떻게 비교하나요?
입력, 권한, 평가 기준, Budget을 고정하고 여러 번 실행하여 품질, Latency, Token, 개입 및 비용을 따로 측정합니다.
Token Plan Credits를 비용 비교에 쓸 수 있나요?
안 됩니다. Credits는 Preview 구독 실험 소비만 설명하며 프로덕션 비교에는 같은 실행에서 실제 청구된 Provider 또는 EvoLink Route 가격을 사용해야 합니다.
어떤 Baseline을 포함해야 하나요?
실제로 교체할 수 있는 Qwen3.7 Max와 Kimi K3에 더해 품질 상한을 볼 Fable 5나 GPT-5.6 등을 포함하세요. 사용할 수 없는 모델을 장식용 비교 대상으로 삼지 마세요.
언제 프로덕션 준비가 되나요?
정확한 Route, ID, 가격, 제한, 동작, Fallback을 검증하고 반복한 실제 작업이 Acceptance 기준을 통과했을 때입니다.
출처
- QwenCloud 모델 릴리스 로그
- Qwen3.8 Max 기술 릴리스 및 Benchmark
- Qwen Token Plan 개인용 개요
- Qwen Chat API
- Qwen Kilo CLI 설정
- Kimi K3 개요
- Trilogy AI 비교
- Qwen3.8 발표


