Seedance 2.5가 EvoLink에 출시되었습니다Seedance 2.5 체험하기

Qwen3.8 Max API

Alibaba Qwen-텍스트 생성-입력 100만 Token당 $1.765부터$1.765 공식 가격-사용 가능
100만 Token 컨텍스트제어 가능한 추론함수 호출 + 구조화 출력명시적 + 암시적 캐싱Chat + Responses + Messages
API 문서
프로덕션 경로운영 중
제공자
Alibaba Qwen
모델
Qwen3.8 Max
컨텍스트 창
1,048,576 Token
프로토콜
Chat · Responses · Messages

Qwen3.8 Max 선택

세 가지 API 프로토콜로 제공되는 프리미엄 추론 경로입니다. 저장소 규모 코딩, 긴 문서 분석, 대규모 근거 자료, 장시간 에이전트, 1,048,576 Token 작업 컨텍스트가 필요한 복잡한 지식 업무에 적합합니다.

Qwen3.8 Max

Alibaba Tongyi Qwen 플래그십 Max 모델

선택됨
입력 100만 Token당 $1.765부터$1.765 공식 가격qwen3.8-max
적합한 작업

저장소 전체 엔지니어링, 다중 문서 종합, Chat·Responses·Messages 기반 도구 중심 에이전트, 재시도와 사람의 수정을 줄여 프리미엄 비용을 정당화할 수 있는 어려운 작업.

입력
$1.765 / 1M120 cr / 1M$1.765 공식 가격
출력
$5.295 / 1M360 cr / 1M$5.295 공식 가격
캐시 쓰기
$2.206 / 1M150 cr / 1M$2.206 공식 가격
캐시 읽기 · 암시적
$0.353 / 1M24 cr / 1M$0.353 공식 가격
캐시 읽기 · 명시적
$0.177 / 1M12 cr / 1M$0.177 공식 가격

Qwen3.8 Max 가격

인터랙티브 계산기로 요청 비용을 추정하세요. 모든 사용자 그룹에 원가 기반 Qwen3.8 Max 요금이 적용됩니다.

Qwen3.8 Max

Token 계산기

요청 1건의 Token 구성을 입력하세요.
캐시 읽기 모드

한 요청은 한 모드만 사용합니다. 명시적: cache_control을 보내고 입력 요금의 125%로 캐시를 생성한 뒤 적중 시 10%를 냅니다. 암시적: 별도 설정과 쓰기 요금 없이 적중 시 20%입니다.

예상 요청 비용

Qwen3.8 Max
원가 요금
USD$0.0035
Credits0.2328
입력 Token0.12 cr
캐시 쓰기 Token0 cr
캐시 읽기 Token · 암시적0.0048 cr
출력 Token0.108 cr

요청당 최소 0.01 Credits가 청구됩니다.

예산 가이드

현재 Token 구성으로 가능한 대략적인 요청 수입니다.
Credits 충전
$10
약 2920회 요청

빠른 테스트용

$50
약 14604회 요청

일반 개발용

$100
약 29209회 요청

프로덕션 평가용

모델 가격

Qwen3.8 Max

모든 컨텍스트 길이
입력 Token
$1.765 / 1M120 cr / 1M$1.765 공식 가격
출력 Token
$5.295 / 1M360 cr / 1M$5.295 공식 가격
캐시 쓰기
$2.206 / 1M150 cr / 1M$2.206 공식 가격
캐시 읽기 · 암시적
$0.353 / 1M24 cr / 1M$0.353 공식 가격
캐시 읽기 · 명시적
$0.177 / 1M12 cr / 1M$0.177 공식 가격

USD와 Credits는 100만 Token 기준입니다. 캐시 쓰기는 명시적 캐시에만 적용됩니다. 한 요청은 명시적 또는 암시적 읽기 중 하나만 사용합니다. 백엔드 실시간 가격이 폴백 가격보다 우선합니다.

내장 도구 요금

웹 검색 · turboChat
$0.0005 호출당0.03 cr 호출당
웹 검색 · maxChat
$0.0006 호출당0.04 cr 호출당
웹 검색 도구Responses
$0.0006 호출당0.04 cr 호출당
텍스트-이미지 검색Responses
$0.0036 호출당0.24 cr 호출당
이미지-이미지 검색Responses
$0.0071 호출당0.48 cr 호출당
PDF 파싱Chat
$0.0030 페이지당0.2 cr 페이지당

내장 도구는 Token 요금에 더해 과금되며 도구가 실제로 실행될 때만 발생합니다. 검색하지 않는 요청에는 이 요금이 붙지 않습니다. Anthropic Messages에서는 상위 제공자가 내장 도구를 무시하므로 실행도 과금도 되지 않습니다.

긴 컨텍스트 추론과 에이전트를 위한 Qwen3.8 Max API

EvoLink 통합 API로 Alibaba Tongyi Qwen 플래그십 Max 모델을 사용하세요. Qwen3.8 Max는 OpenAI Chat Completions, OpenAI Responses, Anthropic Messages에서 완전한 byte passthrough로 동일한 모델을 제공하며 1,048,576 Token 컨텍스트, 제어 가능한 추론, 명시적·암시적 프롬프트 캐싱을 지원합니다. 저장소 규모 엔지니어링, 긴 문서 분석, 다단계 도구 워크플로에 적합합니다.

Qwen3.8 Max
Qwen3.8 Max 사용 사례

프로덕션 모델 스택에서 Qwen3.8 Max가 맡을 역할

플래그십 모델을 모든 요청의 기본 경로로 지정해서는 안 됩니다. 긴 컨텍스트, 지속적인 추론, 복잡한 도구 흐름이 재시도, 인수인계, 사람의 수정 작업을 줄이는 업무에서 가장 큰 가치를 냅니다.

저장소 규모 코딩

아키텍처 문서, 연관 서비스, 테스트 기록, 큰 Diff, 여러 파일에 분산된 제약이 필요한 개발 작업에 사용합니다. 단일 코드 품질보다 실제 채택된 패치와 리뷰 시간을 측정하세요.

긴 문서 분석

연관된 사양서, 논문, 계약서, 로그, 지식베이스 근거를 하나의 작업 컨텍스트에 유지합니다. 검색과 문서 구조는 여전히 중요하며, 100만 Token 창이 불필요한 컨텍스트를 유용하게 만들지는 않습니다.

세 프로토콜 기반 도구 호출 에이전트

Chat, Responses, Messages에서 다단계 도구 선택, 구조화 출력, 반복적인 외부 작업에 적합합니다. 메시지, thinking, 도구 호출 ID, 인자, 결과를 턴 사이에 완전히 유지하세요.

경량 모델이 더 나은 경우

짧은 대화, 분류, 재작성, 단순 추출, 지연 시간에 민감한 UI 작업에는 최대 추론이나 100만 컨텍스트가 거의 필요하지 않습니다. 저렴한 경로에 유지하고 난도가 높을 때만 전환하세요.

프로토콜 및 캐시 특성

EvoLink에서 Qwen3.8 Max가 다른 점

다음은 EvoLink 경로의 계약 수준 기능이지 Benchmark 결론이 아닙니다. 기본 경로로 지정하기 전에 실제 업무에서 지연 시간, 품질, 캐시 동작을 검증하세요.

세 프로토콜 byte passthrough

OpenAI Chat, OpenAI Responses, Anthropic Messages가 byte passthrough로 동일한 모델에 도달하므로 thinking, signature, 캐시 표시가 게이트웨이의 재직렬화 과정에서 손실되지 않습니다.

명시적·암시적 프롬프트 캐싱

cache_control로 재사용 프리픽스를 표시하면 적중 시 입력 요금의 10%, 자동 암시적 캐시는 20%입니다. 한 요청에서 두 모드는 함께 쓸 수 없으며 게이트웨이는 cache_control 표시를 유지합니다.

제어 가능한 추론 강도

추론은 xhigh로 기본 활성화되며 reasoning_effort로 medium 또는 low로 조정할 수 있습니다. 게이트웨이는 필드를 그대로 전달합니다. reasoning_effort와 thinking_budget를 함께 보내면 안 됩니다.

턴 사이에 thinking 재전송

preserve_thinking은 기본 활성화됩니다. 기록에 있는 모든 assistant reasoning_content를 변경 없이 다시 보내고 content에 합치지 마세요. 재전송된 추론은 입력 Token으로 과금됩니다.

핵심 기능

Qwen3.8 Max가 복잡한 워크로드를 처리하는 기반

긴 컨텍스트, 지속적인 추론, 재사용 가능한 프롬프트 프리픽스가 함께 작동할 때 가치가 생깁니다. 컨텍스트 용량만으로 답변이 좋아지지는 않으며 관련 근거, 명확한 구조, 출력 예산이 필요합니다.

100만 Token은 작업 공간이지 채우기 위한 목표가 아님

1,048,576 Token 창에 관련 코드, 사양, 이전 도구 결과를 유지해 과도한 분할을 줄일 수 있습니다. 불필요한 정보는 주의력과 처리 비용을 차지하므로 검색과 컨텍스트 압축이 필요합니다.

지속적인 추론에는 출력 예산이 필요

추론 Token과 최종 답변 Token 모두 사용량에 포함됩니다. 출력 한도를 일반적인 답변 길이가 아닌 용량으로 보고 reasoning_effort로 업무에 맞는 예산을 설정하세요.

안정적인 프리픽스에서 캐시 효율 증가

저장소 지침, 시스템 프롬프트, 참조 자료, 도구 스키마의 순서가 안정적일수록 캐시를 재사용하기 쉽습니다. 모델이나 구조를 자주 바꾸면 긴 프리픽스를 다시 처리합니다.

Function Calling, 내장 도구, Structured Output

Qwen은 프로덕션 모델에 Function Calling, 내장 도구, Structured Output을 명시합니다. 트래픽을 확대하기 전에 EvoLink 경로에서 필요한 도구와 스키마 동작을 검증하세요.

Qwen3.8 Max API 프로덕션 점검

프로덕션 트래픽을 보내기 전 확인 사항

적합한 업무도 잘못된 ID, 엔드포인트와 맞지 않는 최대 Token 필드, 누락된 에이전트 상태 때문에 실패할 수 있습니다. 모델 품질을 평가하기 전에 요청 규격을 확인하세요.

01

모델 ID qwen3.8-max 사용

EvoLink의 Chat Completions, Responses, Anthropic Messages 모두 qwen3.8-max를 사용합니다.

모델 ID
02

엔드포인트별 최대 Token 필드 사용

Chat은 max_completion_tokens, Responses는 max_output_tokens, Anthropic Messages는 max_tokens를 사용합니다. 잘못된 필드는 무시되거나 upstream에서 거부될 수 있습니다.

엔드포인트
03

thinking과 도구 상태를 완전히 재전송

멀티턴 에이전트는 메시지, thinking·signature 블록, 도구 호출 ID, 인자, 결과를 유지해야 합니다. 최종 텍스트만 남기면 상태 연속성이 깨집니다.

도구 상태
04

매 턴 reasoning_content 반환

preserve_thinking은 기본 활성화됩니다. 모든 assistant reasoning_content를 변경 없이 반환하고 content에 합치지 마세요. 재전송 Token은 입력으로 과금됩니다.

Thinking 재전송
05

명시적 캐시는 Chat 또는 Messages에서 생성

캐시 읽기는 세 프로토콜에서 작동하지만 Responses에서 큰 명시적 캐시를 생성하는 경로는 upstream에서 가장 불안정합니다. Chat Completions나 Anthropic Messages에서 cache_control을 표시하고 어떤 프로토콜에서든 읽으세요.

캐싱
프로덕션 비용 평가

Token 단가가 아니라 채택된 작업당 비용 비교

동일한 프로덕션 업무에서 분할, 재시도, 도구 실패, 사람의 수정 작업을 줄일 때만 Qwen3.8 Max의 프리미엄 경로가 타당합니다. 동일한 작업 세트로 비교하세요.

첫 시도 성공률채택 가능한 결과물재시도 횟수출력 Token캐시 적중률유효한 도구 호출채택 가능한 결과까지 걸린 시간사람의 수정과 폴백 비율

더 적은 재시도와 리뷰로 사용할 수 있는 결과를 제공한다면 원가 기반 Token 요금도 총 작업 비용을 낮출 수 있습니다. 차이가 없으면 경량 경로를 유지하세요.

실제 워크로드 테스트 후 주요 장문 모델 비교

EvoLink

먼저 Qwen3.8 Max가 실제 업무에서 재시도와 리뷰 작업을 줄이는지 확인하세요. 그다음 가격, 컨텍스트, 캐싱, 업무 적합성으로 프로덕션 경로를 선택합니다.

Qwen3.8 Max
입력 / 출력$1.765 / $5.295
컨텍스트1M
캐싱명시적 + 암시적
적합한 작업저장소 전체 엔지니어링, 다중 문서 종합, Chat·Responses·Messages 기반 도구 중심 에이전트, 재시도와 사람의 수정을 줄여 프리미엄 비용을 정당화할 수 있는 어려운 작업.
Claude Opus 5
입력 / 출력$4.75 / $23.75
컨텍스트1M
캐싱읽기 + 쓰기
적합한 작업장시간 코딩 에이전트, 복잡한 리뷰, 높은 판단력이 필요한 전문 워크플로를 위한 프리미엄 기준.
Kimi K3
입력 / 출력$3 / $15
컨텍스트1M
캐싱읽기 + 쓰기
적합한 작업저장소 규모 코딩과 다중 문서 추론을 중간 가격으로 제공하는 Moonshot 장문 경로.

관련 모델

Claude Opus 5

Claude Opus 5

장시간 코딩 에이전트, 복잡한 리뷰, 높은 판단력이 필요한 전문 워크플로를 위한 프리미엄 기준.

모델 보기
Kimi K3

Kimi K3

저장소 규모 코딩과 다중 문서 추론을 중간 가격으로 제공하는 Moonshot 장문 경로.

모델 보기
DeepSeek V4

DeepSeek V4

100만 Token 컨텍스트로 대량 코딩, 추론, 에이전트 작업을 처리하는 비용 효율 기준.

모델 보기
GPT-5.6

GPT-5.6

Sol, Terra, Luna 계층으로 성능, 지연 시간, 비용 라우팅 유연성을 직접 비교할 수 있습니다.

모델 보기

Qwen3.8 Max 출시·근거·연동 가이드

Qwen3.8 Max 정식 출시 및 기능

Qwen3.8 Max 정식 출시 및 기능

프로덕션 버전, 초기 채널 차이, 공식 기능, 오픈 웨이트 상태를 구분합니다.

가이드 읽기
Qwen3.8 Max Benchmark 근거

Qwen3.8 Max Benchmark 근거

공식 결과, 제3자 근거, EvoLink 프로덕션 테스트 계획을 확인합니다.

가이드 읽기
Qwen3.8 Max vs Qwen3.7 Max

Qwen3.8 Max vs Qwen3.7 Max

가역적인 체크리스트로 유지, Canary, 전면 마이그레이션을 선택합니다.

가이드 읽기
Qwen3.8 Max vs Kimi K3

Qwen3.8 Max vs Kimi K3

코딩, 에이전트, 장문 컨텍스트, 비용, Main·Challenger·Fallback 역할을 비교합니다.

가이드 읽기

Qwen3.8 Max API 자주 묻는 질문

Qwen3.8 Max API의 모델 ID는 무엇인가요?

EvoLink의 Chat Completions, Responses, Anthropic Messages에서 qwen3.8-max를 사용하세요.

어떤 API 프로토콜을 지원하나요?

OpenAI Chat Completions, OpenAI Responses, Anthropic Messages를 지원합니다. 세 프로토콜 모두 완전한 byte passthrough로 동일한 모델을 제공합니다.

최대 Token 필드는 무엇을 사용해야 하나요?

Chat은 max_completion_tokens, Responses는 max_output_tokens, Anthropic Messages는 max_tokens를 사용합니다. 엔드포인트 고유 필드를 쓰는 것이 가장 안전합니다.

100만 Token 컨텍스트를 지원하나요?

EvoLink 경로는 1,048,576 Token 컨텍스트 창을 제공합니다. 기본으로 채우기보다 실제로 연결된 파일, 문서, 에이전트 상태를 유지하는 데 사용하세요.

추론은 어떻게 작동하나요?

추론은 기본 활성화되며 reasoning_effort의 xhigh, medium, low로 제어합니다. reasoning_effort와 thinking_budget를 함께 보내면 안 됩니다. Messages에서는 thinking과 signature 블록을 보존합니다.

멀티턴 대화에서 reasoning_content를 다시 보내야 하나요?

예. preserve_thinking이 기본 활성화되어 있습니다. 모든 assistant reasoning_content를 변경 없이 다시 보내고 content에 합치지 않아야 합니다. 재전송한 Token은 입력으로 과금됩니다.

캐싱 방식과 비용은 어떻게 되나요?

cache_control을 쓰는 명시적 캐시와 자동 암시적 캐시를 지원하며 한 요청은 하나만 사용합니다. 명시적 적중은 입력의 10%, 암시적은 20%입니다. 명시적 생성은 125%, 암시적은 별도 쓰기 요금이 없습니다.

OpenAI SDK나 Anthropic Messages를 사용할 수 있나요?

예. 같은 EvoLink API 키를 유지하고 qwen3.8-max를 선택해 Chat Completions, Responses 또는 Anthropic Messages를 사용하세요.

실시간 또는 대량 요청의 기본 모델로 적합한가요?

일반적으로 사전 테스트가 필요합니다. 최대 추론과 긴 출력은 단순 작업의 지연과 비용을 높입니다. 짧은 대화, 분류, 가벼운 추출은 더 작은 경로에 유지하세요.

요금은 어떻게 계산되나요?

입력, 출력, 캐시 쓰기, 캐시 읽기를 원가로 과금하며 읽기는 명시적·암시적 두 요금이 있습니다. 백엔드 실시간 가격이 우선합니다.