Responses API
Qwen3.8-Max - Responses API
- OpenAI Responses 프로토콜로 Qwen3.8-Max 호출
- 유연한 입력:
input에 문자열을 전달할 수 있으며, Chat 형식의 메시지 배열도 전달 가능(멀티모달input_text/input_image지원) - 멀티턴 대화:
previous_response_id를 전달해 이전 턴 응답을 연결하면, 서버가 컨텍스트를 자동으로 구성(응답id유효 기간 7일) - 세션 캐시: 요청 헤더에
x-dashscope-session-cache: enable(기본값 disable)을 추가해 활성화하며, 적중은usage.input_tokens_details.cached_tokens참조 - 사고 강도:
reasoning.effort로 제어 - 스트리밍 출력:
stream=true일 때 Responses 이벤트(response.output_text.delta/response.completed등)로 반환
POST
BaseURL 설명: 기본 BaseURL은
https://direct.evolink.ai이며, 텍스트 모델을 더 잘 지원하고 장기 연결을 지원합니다; https://api.evolink.ai는 멀티모달 주력 주소로, 이미지 입력을 포함할 때 이 주소를 사용하세요.세션 캐시: Responses API는 요청 헤더 x-dashscope-session-cache: enable로 서버 측 세션 캐시를 활성화하여 멀티턴 지연과 비용을 절감합니다.인증
헤더
세션 캐시 스위치. enable로 설정하면 서버가 대화 컨텍스트를 자동 캐시하여 멀티턴 추론 지연과 비용을 절감합니다.
사용 가능한 옵션:
enable, disable 본문
application/json
대화 모델 이름
사용 가능한 옵션:
qwen3.8-max 예시:
"qwen3.8-max"
모델 입력. 문자열(순수 텍스트)을 전달할 수 있으며, Chat 형식의 메시지 배열도 전달 가능(멀티모달 input_text / input_image 지원).
시스템 지시로 컨텍스트 시작 위치에 삽입됩니다. previous_response_id를 사용할 때, 이전 턴의 instructions는 이번 턴에 전달되지 않습니다.
이전 턴 응답의 고유 ID(응답 id, 유효 기간 7일). 멀티턴 대화를 연결하는 데 사용하며, 서버가 해당 턴의 입력과 출력을 자동으로 검색·구성하여 컨텍스트로 사용합니다.
이번 생성 출력 콘텐츠의 최대 token 수(사고 포함).
사고 제어.
이번 응답을 저장할지 여부.
true(기본값):previous_response_id로 참조 가능false: 저장하지 않으며, 이후 참조할 수 없음
Responses 이벤트로 스트리밍 반환할지 여부.
샘플링 온도, 범위 [0, 2].
필수 범위:
0 <= x <= 2뉴클리어스 샘플링 매개변수, 범위 (0, 1].
필수 범위:
0 <= x <= 1도구 목록. 내장 도구(web_search 웹 검색, web_extractor 웹 페이지 추출, code_interpreter 코드 인터프리터)와 사용자 정의 function을 지원합니다.