Qwen3.8 Max API
Qwen3.8 Max 선택
세 가지 API 프로토콜로 제공되는 프리미엄 추론 경로입니다. 저장소 규모 코딩, 긴 문서 분석, 대규모 근거 자료, 장시간 에이전트, 1,048,576 Token 작업 컨텍스트가 필요한 복잡한 지식 업무에 적합합니다.
Qwen3.8 Max
Alibaba Tongyi Qwen 플래그십 Max 모델
qwen3.8-max저장소 전체 엔지니어링, 다중 문서 종합, Chat·Responses·Messages 기반 도구 중심 에이전트, 재시도와 사람의 수정을 줄여 프리미엄 비용을 정당화할 수 있는 어려운 작업.
Qwen3.8 Max 가격
인터랙티브 계산기로 요청 비용을 추정하세요. 모든 사용자 그룹에 원가 기반 Qwen3.8 Max 요금이 적용됩니다.
Token 계산기
요청 1건의 Token 구성을 입력하세요.한 요청은 한 모드만 사용합니다. 명시적: cache_control을 보내고 입력 요금의 125%로 캐시를 생성한 뒤 적중 시 10%를 냅니다. 암시적: 별도 설정과 쓰기 요금 없이 적중 시 20%입니다.
예상 요청 비용
Qwen3.8 Max요청당 최소 0.01 Credits가 청구됩니다.
예산 가이드
현재 Token 구성으로 가능한 대략적인 요청 수입니다.빠른 테스트용
일반 개발용
프로덕션 평가용
모델 가격
| 모델 | 컨텍스트 | 입력 Token | 출력 Token | 캐시 쓰기 | 캐시 읽기 · 암시적 | 캐시 읽기 · 명시적 |
|---|---|---|---|---|---|---|
Qwen3.8 Maxqwen3.8-max | 모든 컨텍스트 길이 | $1.765 / 1M120 cr / 1M$1.765 공식 가격 | $5.295 / 1M360 cr / 1M$5.295 공식 가격 | $2.206 / 1M150 cr / 1M$2.206 공식 가격 | $0.353 / 1M24 cr / 1M$0.353 공식 가격 | $0.177 / 1M12 cr / 1M$0.177 공식 가격 |
Qwen3.8 Max
모든 컨텍스트 길이USD와 Credits는 100만 Token 기준입니다. 캐시 쓰기는 명시적 캐시에만 적용됩니다. 한 요청은 명시적 또는 암시적 읽기 중 하나만 사용합니다. 백엔드 실시간 가격이 폴백 가격보다 우선합니다.
내장 도구 요금
내장 도구는 Token 요금에 더해 과금되며 도구가 실제로 실행될 때만 발생합니다. 검색하지 않는 요청에는 이 요금이 붙지 않습니다. Anthropic Messages에서는 상위 제공자가 내장 도구를 무시하므로 실행도 과금도 되지 않습니다.
긴 컨텍스트 추론과 에이전트를 위한 Qwen3.8 Max API
EvoLink 통합 API로 Alibaba Tongyi Qwen 플래그십 Max 모델을 사용하세요. Qwen3.8 Max는 OpenAI Chat Completions, OpenAI Responses, Anthropic Messages에서 완전한 byte passthrough로 동일한 모델을 제공하며 1,048,576 Token 컨텍스트, 제어 가능한 추론, 명시적·암시적 프롬프트 캐싱을 지원합니다. 저장소 규모 엔지니어링, 긴 문서 분석, 다단계 도구 워크플로에 적합합니다.

프로덕션 모델 스택에서 Qwen3.8 Max가 맡을 역할
플래그십 모델을 모든 요청의 기본 경로로 지정해서는 안 됩니다. 긴 컨텍스트, 지속적인 추론, 복잡한 도구 흐름이 재시도, 인수인계, 사람의 수정 작업을 줄이는 업무에서 가장 큰 가치를 냅니다.
저장소 규모 코딩
아키텍처 문서, 연관 서비스, 테스트 기록, 큰 Diff, 여러 파일에 분산된 제약이 필요한 개발 작업에 사용합니다. 단일 코드 품질보다 실제 채택된 패치와 리뷰 시간을 측정하세요.
긴 문서 분석
연관된 사양서, 논문, 계약서, 로그, 지식베이스 근거를 하나의 작업 컨텍스트에 유지합니다. 검색과 문서 구조는 여전히 중요하며, 100만 Token 창이 불필요한 컨텍스트를 유용하게 만들지는 않습니다.
세 프로토콜 기반 도구 호출 에이전트
Chat, Responses, Messages에서 다단계 도구 선택, 구조화 출력, 반복적인 외부 작업에 적합합니다. 메시지, thinking, 도구 호출 ID, 인자, 결과를 턴 사이에 완전히 유지하세요.
경량 모델이 더 나은 경우
짧은 대화, 분류, 재작성, 단순 추출, 지연 시간에 민감한 UI 작업에는 최대 추론이나 100만 컨텍스트가 거의 필요하지 않습니다. 저렴한 경로에 유지하고 난도가 높을 때만 전환하세요.
EvoLink에서 Qwen3.8 Max가 다른 점
다음은 EvoLink 경로의 계약 수준 기능이지 Benchmark 결론이 아닙니다. 기본 경로로 지정하기 전에 실제 업무에서 지연 시간, 품질, 캐시 동작을 검증하세요.
세 프로토콜 byte passthrough
OpenAI Chat, OpenAI Responses, Anthropic Messages가 byte passthrough로 동일한 모델에 도달하므로 thinking, signature, 캐시 표시가 게이트웨이의 재직렬화 과정에서 손실되지 않습니다.
명시적·암시적 프롬프트 캐싱
cache_control로 재사용 프리픽스를 표시하면 적중 시 입력 요금의 10%, 자동 암시적 캐시는 20%입니다. 한 요청에서 두 모드는 함께 쓸 수 없으며 게이트웨이는 cache_control 표시를 유지합니다.
제어 가능한 추론 강도
추론은 xhigh로 기본 활성화되며 reasoning_effort로 medium 또는 low로 조정할 수 있습니다. 게이트웨이는 필드를 그대로 전달합니다. reasoning_effort와 thinking_budget를 함께 보내면 안 됩니다.
턴 사이에 thinking 재전송
preserve_thinking은 기본 활성화됩니다. 기록에 있는 모든 assistant reasoning_content를 변경 없이 다시 보내고 content에 합치지 마세요. 재전송된 추론은 입력 Token으로 과금됩니다.
Qwen3.8 Max가 복잡한 워크로드를 처리하는 기반
긴 컨텍스트, 지속적인 추론, 재사용 가능한 프롬프트 프리픽스가 함께 작동할 때 가치가 생깁니다. 컨텍스트 용량만으로 답변이 좋아지지는 않으며 관련 근거, 명확한 구조, 출력 예산이 필요합니다.
100만 Token은 작업 공간이지 채우기 위한 목표가 아님
1,048,576 Token 창에 관련 코드, 사양, 이전 도구 결과를 유지해 과도한 분할을 줄일 수 있습니다. 불필요한 정보는 주의력과 처리 비용을 차지하므로 검색과 컨텍스트 압축이 필요합니다.
지속적인 추론에는 출력 예산이 필요
추론 Token과 최종 답변 Token 모두 사용량에 포함됩니다. 출력 한도를 일반적인 답변 길이가 아닌 용량으로 보고 reasoning_effort로 업무에 맞는 예산을 설정하세요.
안정적인 프리픽스에서 캐시 효율 증가
저장소 지침, 시스템 프롬프트, 참조 자료, 도구 스키마의 순서가 안정적일수록 캐시를 재사용하기 쉽습니다. 모델이나 구조를 자주 바꾸면 긴 프리픽스를 다시 처리합니다.
Function Calling, 내장 도구, Structured Output
Qwen은 프로덕션 모델에 Function Calling, 내장 도구, Structured Output을 명시합니다. 트래픽을 확대하기 전에 EvoLink 경로에서 필요한 도구와 스키마 동작을 검증하세요.
프로덕션 트래픽을 보내기 전 확인 사항
적합한 업무도 잘못된 ID, 엔드포인트와 맞지 않는 최대 Token 필드, 누락된 에이전트 상태 때문에 실패할 수 있습니다. 모델 품질을 평가하기 전에 요청 규격을 확인하세요.
모델 ID qwen3.8-max 사용
EvoLink의 Chat Completions, Responses, Anthropic Messages 모두 qwen3.8-max를 사용합니다.
엔드포인트별 최대 Token 필드 사용
Chat은 max_completion_tokens, Responses는 max_output_tokens, Anthropic Messages는 max_tokens를 사용합니다. 잘못된 필드는 무시되거나 upstream에서 거부될 수 있습니다.
thinking과 도구 상태를 완전히 재전송
멀티턴 에이전트는 메시지, thinking·signature 블록, 도구 호출 ID, 인자, 결과를 유지해야 합니다. 최종 텍스트만 남기면 상태 연속성이 깨집니다.
매 턴 reasoning_content 반환
preserve_thinking은 기본 활성화됩니다. 모든 assistant reasoning_content를 변경 없이 반환하고 content에 합치지 마세요. 재전송 Token은 입력으로 과금됩니다.
명시적 캐시는 Chat 또는 Messages에서 생성
캐시 읽기는 세 프로토콜에서 작동하지만 Responses에서 큰 명시적 캐시를 생성하는 경로는 upstream에서 가장 불안정합니다. Chat Completions나 Anthropic Messages에서 cache_control을 표시하고 어떤 프로토콜에서든 읽으세요.
Token 단가가 아니라 채택된 작업당 비용 비교
동일한 프로덕션 업무에서 분할, 재시도, 도구 실패, 사람의 수정 작업을 줄일 때만 Qwen3.8 Max의 프리미엄 경로가 타당합니다. 동일한 작업 세트로 비교하세요.
더 적은 재시도와 리뷰로 사용할 수 있는 결과를 제공한다면 원가 기반 Token 요금도 총 작업 비용을 낮출 수 있습니다. 차이가 없으면 경량 경로를 유지하세요.
실제 워크로드 테스트 후 주요 장문 모델 비교
EvoLink먼저 Qwen3.8 Max가 실제 업무에서 재시도와 리뷰 작업을 줄이는지 확인하세요. 그다음 가격, 컨텍스트, 캐싱, 업무 적합성으로 프로덕션 경로를 선택합니다.
| 모델 | Qwen3.8 Max | Claude Opus 5 | Kimi K3 |
|---|---|---|---|
| 입력 / 출력 | $1.765 / $5.295 | $4.75 / $23.75 | $3 / $15 |
| 컨텍스트 | 1M | 1M | 1M |
| 캐싱 | 명시적 + 암시적 | 읽기 + 쓰기 | 읽기 + 쓰기 |
| 적합한 작업 | 저장소 전체 엔지니어링, 다중 문서 종합, Chat·Responses·Messages 기반 도구 중심 에이전트, 재시도와 사람의 수정을 줄여 프리미엄 비용을 정당화할 수 있는 어려운 작업. | 장시간 코딩 에이전트, 복잡한 리뷰, 높은 판단력이 필요한 전문 워크플로를 위한 프리미엄 기준. | 저장소 규모 코딩과 다중 문서 추론을 중간 가격으로 제공하는 Moonshot 장문 경로. |
관련 모델




Qwen3.8 Max 출시·근거·연동 가이드




Qwen3.8 Max API 자주 묻는 질문
Qwen3.8 Max API의 모델 ID는 무엇인가요?
EvoLink의 Chat Completions, Responses, Anthropic Messages에서 qwen3.8-max를 사용하세요.
어떤 API 프로토콜을 지원하나요?
OpenAI Chat Completions, OpenAI Responses, Anthropic Messages를 지원합니다. 세 프로토콜 모두 완전한 byte passthrough로 동일한 모델을 제공합니다.
최대 Token 필드는 무엇을 사용해야 하나요?
Chat은 max_completion_tokens, Responses는 max_output_tokens, Anthropic Messages는 max_tokens를 사용합니다. 엔드포인트 고유 필드를 쓰는 것이 가장 안전합니다.
100만 Token 컨텍스트를 지원하나요?
EvoLink 경로는 1,048,576 Token 컨텍스트 창을 제공합니다. 기본으로 채우기보다 실제로 연결된 파일, 문서, 에이전트 상태를 유지하는 데 사용하세요.
추론은 어떻게 작동하나요?
추론은 기본 활성화되며 reasoning_effort의 xhigh, medium, low로 제어합니다. reasoning_effort와 thinking_budget를 함께 보내면 안 됩니다. Messages에서는 thinking과 signature 블록을 보존합니다.
멀티턴 대화에서 reasoning_content를 다시 보내야 하나요?
예. preserve_thinking이 기본 활성화되어 있습니다. 모든 assistant reasoning_content를 변경 없이 다시 보내고 content에 합치지 않아야 합니다. 재전송한 Token은 입력으로 과금됩니다.
캐싱 방식과 비용은 어떻게 되나요?
cache_control을 쓰는 명시적 캐시와 자동 암시적 캐시를 지원하며 한 요청은 하나만 사용합니다. 명시적 적중은 입력의 10%, 암시적은 20%입니다. 명시적 생성은 125%, 암시적은 별도 쓰기 요금이 없습니다.
OpenAI SDK나 Anthropic Messages를 사용할 수 있나요?
예. 같은 EvoLink API 키를 유지하고 qwen3.8-max를 선택해 Chat Completions, Responses 또는 Anthropic Messages를 사용하세요.
실시간 또는 대량 요청의 기본 모델로 적합한가요?
일반적으로 사전 테스트가 필요합니다. 최대 추론과 긴 출력은 단순 작업의 지연과 비용을 높입니다. 짧은 대화, 분류, 가벼운 추출은 더 작은 경로에 유지하세요.
요금은 어떻게 계산되나요?
입력, 출력, 캐시 쓰기, 캐시 읽기를 원가로 과금하며 읽기는 명시적·암시적 두 요금이 있습니다. 백엔드 실시간 가격이 우선합니다.