Responses API
Qwen3.8-Max-Preview - Responses 接口
🚧 该模型暂未开放,敬请期待
- 使用 OpenAI Responses 协议调用 Qwen3.8-Max-Preview
- 输入灵活:
input可传字符串,也可传 Chat 格式的消息数组(支持多模态input_text/input_image) - 多轮对话:传
previous_response_id关联上一轮响应,服务端自动组合上下文(响应id有效期 7 天) - 会话缓存:请求头加
x-dashscope-session-cache: enable(默认 disable)开启,命中见usage.input_tokens_details.cached_tokens - 思考强度:通过
reasoning.effort控制 - 流式输出:
stream=true时按 Responses 事件(response.output_text.delta/response.completed等)返回
POST
BaseURL 说明:默认 BaseURL 为
https://direct.evolink.ai,对文本模型支持更好,支持长连接;https://api.evolink.ai 是多模态主力地址,含图像输入时请使用该地址。会话缓存:Responses 接口通过请求头 x-dashscope-session-cache: enable 开启服务端会话缓存以降低多轮延迟与成本。授权
请求头
会话缓存开关。设为 enable 时,服务端自动缓存对话上下文以降低多轮推理延迟与成本。
可用选项:
enable, disable 请求体
application/json
对话模型名称
可用选项:
qwen3.8-max-preview 示例:
"qwen3.8-max-preview"
模型输入。可传字符串(纯文本),也可传 Chat 格式的消息数组(支持多模态 input_text / input_image)。
作为系统指令插入到上下文起始位置。使用 previous_response_id 时,上一轮的 instructions 不会传入本轮。
上一轮响应的唯一 ID(响应 id,有效期 7 天)。用于关联多轮对话,服务端自动检索并组合该轮的输入与输出作为上下文。
本次生成输出内容的最大 token 数(含思考)。
思考控制。
是否存储本次响应。
true(默认):可被previous_response_id引用false:不存储,后续无法引用
是否以 Responses 事件流式返回。
采样温度,取值范围 [0, 2]。
必填范围:
0 <= x <= 2核采样参数,取值范围 (0, 1]。
必填范围:
0 <= x <= 1工具列表。支持内置工具(web_search 联网搜索、web_extractor 网页抓取、code_interpreter 代码解释器)及自定义 function。