DeepSeek V4 - Responses 인터페이스
- OpenAI Responses 프로토콜로 DeepSeek V4 모델을 호출합니다
deepseek-v4-flash(빠른 범용)와deepseek-v4-pro(심층 추론) 두 모델을 지원합니다- 입력 형태:
input은 일반 텍스트일 수도 있고, 입력 항목 배열(메시지, 함수 호출, 함수 결과, 사고, 검색 기록)일 수도 있습니다 - 시스템 지시:
instructions로 전달하며, 맨 앞의 system 메시지와 동일합니다 - 사고 모드:
reasoning.effort로 추론 강도를 제어하며, 사고 내용은reasoning출력 항목으로 반환됩니다 - 스트리밍 출력: 시맨틱 SSE 이벤트를 지원하며
response.completed로 종료되고,[DONE]은 전송되지 않습니다 - 도구 호출: Function Calling과 내장
web_search웹 검색을 지원합니다 - 구조화 출력:
text.format으로 JSON 객체 또는 JSON Schema를 활성화합니다 - 컨텍스트 캐시: 동일한 접두사를 가진 요청은 자동으로 캐시에 적중하여 입력 비용을 크게 낮춥니다
스트리밍 이벤트: response.created, response.output_item.added, response.reasoning_text.delta, response.output_text.delta이며, 종료 이벤트는 response.completed / response.incomplete / response.failed입니다. 모든 이벤트에는 정렬용 sequence_number가 포함됩니다.
효과가 없는 필드: 다음 OpenAI 필드는 그대로 전송해도 오류가 발생하지 않지만 실제 효과는 없습니다.
| 필드 | 동작 |
|---|---|
store | 항상 false이며 응답을 저장하지 않습니다 |
previous_response_id | 항상 null이며 대화 이어가기를 지원하지 않습니다 |
conversation | 미지원 |
background / metadata / include | 무시 |
prompt / truncation / service_tier | 무시 |
safety_identifier / context_management | 무시 |
stream_options | 무시 |
parallel_tool_calls | 무시되며 병렬 도구 호출은 항상 활성화됩니다 |
max_tool_calls | 무시 |
file_search / code_interpreter / mcp 도구 | 무시 |
기타 제한:
- 커스텀 도구(
type: custom)는apply_patch만 지원합니다 web_search도구는search_context_size와user_location을 무시합니다- 이미지와 파일 콘텐츠 블록은 플레이스홀더로 변환됩니다. DeepSeek V4는 비전 모델이 아닙니다
- 입력이 컨텍스트 윈도우를 초과하면 400을 반환하며 자동 절단은 수행하지 않습니다
https://direct.evolink.ai이며, 텍스트 모델 지원이 더 우수하고 장시간 연결을 지원합니다. https://api.evolink.ai는 멀티모달 서비스의 주력 엔드포인트이며, 텍스트 모델에 대해서는 대체 주소로 사용됩니다.인증
본문
모델 ID
deepseek-v4-flash: 빠른 범용 모델로 일상 대화, 요약, 추출에 적합합니다deepseek-v4-pro: 심층 추론 모델로 복잡한 수학, 코드, 다단계 계획에 적합합니다
deepseek-v4-flash, deepseek-v4-pro "deepseek-v4-flash"
모델 입력입니다. input과 instructions 중 최소 하나는 제공해야 합니다.
- 문자열 형태: 전체 텍스트가 하나의
user메시지로 처리됩니다 - 배열 형태: 입력 항목 목록으로
message,function_call,function_call_output,reasoning,web_search_call다섯 가지 유형을 지원합니다
멀티턴 대화: 본 인터페이스는 무상태이므로 대화를 이어가려면 전체 히스토리를 배열에 담아야 합니다.
"항저우를 한 문장으로 소개해 주세요."
시스템 수준 지시로, 맨 앞에 삽입되는 system 메시지와 동일하며 역할, 어조, 출력 제약을 설정하는 데 사용합니다.
"당신은 꼼꼼한 기술 문서 작성자입니다. 답변은 간결하게 유지하세요."
스트리밍 반환 여부
false(기본값): 완전한 응답 객체를 한 번에 반환합니다true: 시맨틱 SSE 이벤트로 전송하며, 마지막 이벤트는response.completed/response.incomplete/response.failed이고[DONE]은 전송되지 않습니다
false
이번 생성의 최대 출력 토큰 수(사고 토큰 포함)입니다. 범위는 1 ~ 393216(384K)이며, 비워 두면 모델이 스스로 결정합니다.
1 <= x <= 3932164096
샘플링 온도로, 값이 클수록 출력이 무작위해집니다. 사고 모드에서는 적용되지 않습니다.
0 <= x <= 21
뉴클리어스 샘플링 임계값으로, temperature와 둘 중 하나만 조정하기를 권장합니다. 사고 모드에서는 적용되지 않습니다.
x <= 11
각 위치에서 확률이 가장 높은 후보 토큰과 그 로그 확률을 반환합니다.
0 <= x <= 200
사고 모드 설정입니다. DeepSeek V4는 기본적으로 사고가 활성화되어 있으며, 사고 내용은 reasoning 출력 항목으로 반환되고 해당 토큰은 출력에 포함되어 출력 단가로 과금됩니다.
텍스트 출력 형식 설정입니다.
모델이 호출할 수 있는 도구 목록입니다. 함수 도구는 클라이언트가 실행하고 결과를 function_call_output으로 반환하며, web_search는 서버 측에서 직접 실행되어 클라이언트 개입이 필요 없습니다.
도구 호출 전략
none: 도구 호출 금지auto(기본값): 모델이 결정required: 최소 하나의 도구를 반드시 호출{"type": "function", "name": "get_weather"}: 지정한 함수를 강제로 호출{"type": "web_search"}: 웹 검색을 강제로 실행
"auto"
응답
생성 성공
Responses 인터페이스의 응답 객체입니다.
이번 응답의 고유 식별자
"resp_9f2c1a4b8e7d"
객체 유형이며 항상 response
"response"
생성 시각(Unix 타임스탬프, 초)
1755000000
응답 상태
completed: 정상 완료in_progress: 생성 중incomplete: 길이 등의 이유로 잘림. 자세한 내용은incomplete_details참조failed: 생성 실패. 자세한 내용은error참조
in_progress, completed, incomplete, failed "completed"
실제로 이번 응답을 생성한 모델 ID
"deepseek-v4-flash"
생성 순서대로 나열된 출력 항목 목록입니다. 유형별 필드:
reasoning: 사고 과정이며id,status,content(reasoning_text블록 목록),summary를 포함합니다message: 최종 답변이며id,status,role,content(output_text블록 목록)를 포함합니다function_call: 모델이 발생시킨 함수 호출이며id,status,call_id,name,arguments를 포함하고, 클라이언트가 실행한 뒤function_call_output으로 반환합니다web_search_call: 서버 측에서 실행된 웹 검색 기록이며id,status,action(수행된 검색 내용)을 포함합니다
실패 원인이며 성공 시에는 null
잘림 원인이며 잘리지 않았을 때는 null
토큰 사용 통계(캐시 및 추론 세부 항목 포함)