적응형 사고Effort 제어도구 사용구조화된 출력프롬프트 캐싱Chat + Messages API
프로덕션 라우트이 성공률은 플랫폼 측 가용성을 나타냅니다. 확인된 서버 오류(HTTP 500 / 빈 응답)만 실패로 집계됩니다. 사용자 측 문제(콘텐츠 검열, 잘못된 파라미터, 취소)와 속도 제한, 타임아웃, 인증 오류는 제외됩니다. 실제 트래픽이 들어오기 전에는 빈 구간이 가용으로 표시될 수 있습니다.라이브
웹 검색 지원 여부는 선택한 라우트에 따라 다르며 일부 라우트에서는 사용할 수 없습니다. web_search를 보내기 전에 지원 여부를 확인하세요. 아래 요금은 지원하는 라우트에만 적용됩니다.
웹 검색$0.010/ 회·0.68 cr / 회
Claude Haiku 5.5 API
EvoLink 통합 게이트웨이로 Claude Haiku 5.5 API를 이용하세요. 이 페이지의 현재 Haiku 버전은 Claude Haiku 5.5입니다. EvoLink 통합 API로 대량 분류, 추출, 라우팅, 서브 에이전트 호출을 실행할 수 있으며, 100만 토큰 컨텍스트 윈도와 최대 12.8만 출력 토큰을 제공합니다. 10만 토큰 이하 프롬프트 기준 100만 토큰당 입력 $0.096, 출력 $0.475의 요금을 비교하고, API 키 하나를 여러 모델에 재사용하고, 첫 요청 전에 thinking과 max_tokens 설정을 확인하세요.
Claude Haiku 5.5은(는) EvoLink에서 모델 ID claude-haiku-5-5로 Chat Completions · Anthropic Messages를 통해 제공되며, 다른 모든 모델과 같은 API 키와 잔액을 사용합니다. 1M 컨텍스트 윈도우와 최대 128K 출력 토큰, 그리고 도구 사용, 구조화 출력, 프롬프트 캐싱를 제공합니다.
Claude Haiku 5.5 사양과 기능
숫자는 EvoLink 경로 설정에서 가져오며, 기능은 API가 현재 제공하는 범위입니다.
컨텍스트 윈도우
1M 토큰
최대 출력
128K 토큰
입력
텍스트 + 이미지
출력
텍스트 · JSON(구조화 출력) · 도구 호출
추론
생각 모드(기본 켜짐)
도구 사용
여러 단계 도구 시퀀스를 지원하는 함수 호출
프롬프트 캐싱
캐시 쓰기 + 캐시 읽기 요금
긴 컨텍스트 구간
프롬프트 100K 토큰 초과 시 ×5
프로토콜
Chat Completions · Anthropic Messages
모델 ID
claude-haiku-5-5
Claude Haiku 5.5가 맞는 기본 라우트인 경우
Haiku 5.5는 대량 처리와 지연 시간에 민감한 작업을 위한 Anthropic의 빠르고 저렴한 Claude입니다. 완료된 작업의 비용으로 라우트를 고르고, 프롬프트를 고치기 전에 effort부터 조정하세요.
대량 분류, 라우팅, 추출
티켓에 라벨을 붙이고, 의도를 파악하고, 요청을 라우팅하고, 문서에서 필드를 뽑아 JSON으로 만듭니다. 각 프롬프트를 간결하게 유지하고 구조화된 출력이나 값을 enum으로 제한한 도구로 답변을 제약하면, 응답이 짧게 유지되고 요청이 기본 요금표에 머뭅니다.
더 큰 모델 아래의 서브 에이전트
Opus나 Sonnet 모델이 작업을 계획하는 동안 검색, 파일 읽기 같은 범위가 좁은 단계를 Haiku 5.5에서 실행합니다. Anthropic은 Haiku 5.5가 지시를 따르는 능력과 서브 에이전트로 동작하는 능력에서 Haiku 4.5보다 크게 나아졌다고 설명합니다. 개별 응답이 아니라 완료된 단계를 측정하세요.
저지연 채팅 및 지원 어시스턴트
짧은 시스템 프롬프트로 일상적인 질문에 답하고 소수의 도구를 호출합니다. 채팅과 짧은 도구 작업은 low effort에서 시작하고, 어시스턴트가 긴 대화 내내 엄격한 규칙을 따라야 하는 곳에서는 effort를 높이세요.
다른 라우트가 더 나은 경우
여러 파일에 걸친 코딩, 장기 에이전트, 애널리스트 수준의 글쓰기는 Claude Sonnet 5.5에 맡기세요. 그 위에는 Claude Opus 5.5가 있습니다. 샘플링 파라미터, 사고 예산, 어시스턴트 프리필에 의존하면서 아직 재테스트하지 않은 워크로드는 Claude Haiku 4.5에 남겨 두세요.
Claude Haiku 5.5을(를) 사용하는 두 가지 방법: EvoLink API 또는 Agent
프로덕트 백엔드와 배치 작업에는 EvoLink API를, 코딩·분석 워크플로에는 Codex, Claude, Gemini에서 Claude Haiku 5.5을(를) 직접 호출하세요. 두 경로 모두 같은 EvoLink API 키, 잔액, 모델 ID, 요청 기록을 공유합니다.
방법 1
EvoLink API로 통합
적합한 용도: 프로덕트 백엔드, 배치 작업, 자동화 파이프라인
OpenAI 호환 Chat Completions(또는 Anthropic Messages) 요청을 EvoLink로 보내고 모델 ID, 시스템 프롬프트, 출력 예산, 도구, 구조화 출력을 직접 제어합니다.
1콘솔에서 EvoLink API 키를 만드세요
2OpenAI 또는 Anthropic SDK의 base URL을 EvoLink로 지정하고 위에 표시된 모델 ID를 선택하세요
3대표 요청을 한 번 보내고 usage 필드에서 입력·캐시·출력 토큰을 확인하세요
4작업별로 max_tokens와 재시도를 설정하고, 여러 턴에서는 tool-call ID와 결과를 유지하세요
curl -X POST https://direct.evolink.ai/v1/chat/completions \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"messages": [
{ "role": "system", "content": "Classify each support ticket as billing, bug, or how-to. Reply with one word." },
{ "role": "user", "content": "I was charged twice for my subscription." }
],
"max_tokens": 4096
}'
# Thinking is on by default and counts toward max_tokens, so leave room for
# it. This Chat Completions request returns choices[0].message and usage
# (prompt_tokens, completion_tokens, and cache read / write tokens when
# caching applies).
# For the Anthropic Messages format at /v1/messages, follow the linked
# Claude reference; its request fields and response format are different.
잘못된 요청 또는 지원하지 않는 파라미터
API 레퍼런스를 기준으로 모델 ID, messages 배열, 파라미터 범위를 확인하고 이 경로가 지원하지 않는 필드를 제거하세요.
인증 또는 잔액 문제
Authorization Bearer 토큰을 확인하고 콘솔에서 사용 가능한 잔액을 확인하세요.
컨텍스트 길이 초과
프롬프트 토큰이 Claude Haiku 5.5의 컨텍스트 윈도우를 초과했습니다. 관련 근거만 잘라내거나 검색해 넣고 캐시된 프리픽스를 재사용하세요.
속도 제한(429)
지터를 두고 백오프 후 재시도하고, 병렬 버스트 대신 배치나 큐로 보내세요.
콘텐츠 또는 도구 호출 거부
재시도 전에 민감한 콘텐츠, 잘못된 tool-call 인자, JSON 스키마 불일치를 확인하세요.
Claude Haiku 5.5 API 연결 전 확인 사항
EvoLink 클라이언트와 API 키는 하나로 유지하세요. 대부분의 요청은 그대로 쓸 수 있고, 아래 네 단계가 Claude Haiku 4.5와 동작이 달라지는 설정을 다룹니다.
01
모델 ID 바꾸기
클라이언트를 EvoLink로 향하게 하고 같은 API 키로 claude-haiku-5-5를 선택합니다. OpenAI 호환 Chat Completions 엔드포인트와 Anthropic Messages 엔드포인트 모두 이 ID를 받습니다.
이전 부담 적음
02
사고를 위한 여유 남기기
사고는 기본으로 켜져 있고 max_tokens에 포함되므로, 한 단어 답변에 맞춘 상한은 텍스트가 쓰이기도 전에 소진될 수 있습니다. max_tokens를 높이거나 effort를 낮추고, 응답이 thinking 블록으로 시작할 수 있으므로 content는 블록 유형별로 읽으세요.
동작 변경
03
Haiku 4.5 전용 설정 제거
Anthropic은 Haiku 5.5에서 사고 예산, 기본값이 아닌 샘플링 값, 어시스턴트 프리필을 거부합니다. EvoLink는 사고 예산을 effort 수준이 지정된 적응형 사고로 변환하고 temperature, top_p, top_k를 제거합니다. 프리필은 구조화된 출력이나 시스템 프롬프트 지시로 대체하세요.
호환성 깨짐
04
프롬프트 10만 토큰 기준선 살피기
입력, 캐시 쓰기, 캐시 읽기를 합친 값이 요금표를 결정합니다. 기록을 줄이거나, 검색해 오는 양을 줄이거나, 작업을 나눠 대량 요청을 프롬프트 10만 토큰 이하로 유지하고, 더 많은 컨텍스트가 필요한 요청은 더 높은 요금표 기준으로 예산을 잡으세요.
비용 관리
반복되는 컨텍스트를 위한 프롬프트 캐싱
안정적인 시스템 프롬프트, 도구 스키마, 참조 문서를 캐시하면 여러 요청에서 재사용할 수 있습니다. 쓰기와 읽기는 별도로 청구됩니다. Anthropic은 Haiku 4.5보다 캐시 가능한 최소 프롬프트 길이를 낮췄으므로 이제 더 짧은 프롬프트도 캐시할 수 있습니다. 캐시된 토큰도 요금표를 결정하는 프롬프트 길이에 포함됩니다.
100만 토큰 컨텍스트, 10만 토큰에서 바뀌는 요금표
이 라우트는 100만 토큰 컨텍스트 윈도와 최대 12.8만 출력 토큰을 기록합니다. 입력, 캐시 쓰기, 캐시 읽기를 합쳐 10만 토큰 이하인 프롬프트에는 기본 요금이 적용되고, 10만 토큰을 넘으면 출력을 포함한 요청 전체가 5배로 과금됩니다. 사고는 max_tokens에 포함되므로 여유를 남겨 두세요.
사고는 기본으로 켜짐 — 제어 수단은 effort
thinking을 설정하지 않은 요청은 적응형 사고로 실행되며, 수준을 지정하지 않으면 medium effort가 적용됩니다. 사고는 출력으로 과금되고, 요약을 요청하지 않으면 그 텍스트는 생략됩니다. thinking: disabled는 high 이하 effort에서 여전히 허용되지만, Anthropic은 그 대신 effort를 낮추기를 권장합니다.
더 이상 적용되지 않는 Haiku 4.5 파라미터
Anthropic은 Haiku 5.5에서 사고 예산, 기본값이 아닌 샘플링 값, 어시스턴트 프리필을 거부합니다. EvoLink는 호환성을 위해 예산을 effort 수준이 지정된 적응형 사고로 변환하고 temperature, top_p, top_k를 제거합니다. 도구 강제 선택은 허용되지만, 이 경우 응답은 사고 없이 도구 호출로 시작합니다.
Claude Haiku 5.5: 두 가지 요금표와 다섯 가지 과금 항목
Claude Haiku 5.5는 하나의 혼합 요금으로 청구되지 않습니다. 프롬프트 길이가 요금표를 결정하고, 각 항목은 따로 계량되며, 사고는 출력으로 과금됩니다.
프롬프트 길이에 따른 입력 토큰과 출력 토큰
10만 토큰 이하 프롬프트는 EvoLink에서 입력 100만 토큰당 $0.096, 출력 100만 토큰당 $0.475이며, Anthropic 공식가는 $0.100와 $0.500입니다. 프롬프트가 10만 토큰을 넘으면 요청 전체가 더 높은 요금표로 넘어가 입력 $0.478, 출력 $2.375로 과금됩니다. 사고는 텍스트가 반환되지 않아도 출력으로 과금됩니다.
5분 캐시 쓰기 및 캐시 읽기
접두사를 5분 동안 저장하는 비용은 100만 토큰당 $0.120, 재사용하는 비용은 100만 토큰당 $0.011입니다. 캐시된 토큰도 요금표를 결정하는 프롬프트 길이에 포함됩니다. EvoLink 요금은 과금 단위의 정수로 올림되므로 캐시 읽기 요금이 공식 정가보다 약간 높을 수 있습니다. 절감액을 추정할 때는 표시된 가격을 사용하세요.
웹 검색 도구
web_search를 지원하는 라우트에서는 검색 1회당 $0.010이며, 더 높은 요금표의 배수가 적용되지 않습니다. 검색 결과 토큰은 일반 입력으로 과금됩니다. 연결 전에 라우트의 지원 여부를 확인하세요. 요금이 설정되어 있어도 모든 라우트에서 도구를 지원하는 것은 아닙니다.
워크로드 테스트 후 Claude 라우트 비교
EvoLink
먼저 운영할 effort 수준에서 Haiku 5.5가 자체 작업의 품질을 유지하는지 확인하세요. 그다음 가격, 컨텍스트, 캐싱, 워크로드 적합성을 비교해 프로덕션 라우트를 정하세요.
이 페이지는 EvoLink에서 모델 ID "claude-haiku-5-5"로 사용할 수 있는 Claude Haiku 5.5를 다룹니다. Haiku는 모델 제품군 이름이므로 요청에 "haiku"를 모델 ID로 보내지 말고 정확한 버전을 지정하세요. Claude Haiku 4.5는 별도의 모델 페이지와 요금이 있습니다.
Claude Haiku 5.5 API에는 어떤 모델 ID를 써야 하나요?
model에 "claude-haiku-5-5"를 보내세요. OpenAI 호환 Chat Completions 엔드포인트와 Anthropic Messages 엔드포인트 모두 같은 ID를 씁니다.
EvoLink에서 Claude Haiku 5.5 API 가격은 얼마인가요?
10만 토큰 이하 프롬프트의 경우 EvoLink 가격은 입력 100만 토큰당 $0.096, 출력 100만 토큰당 $0.475이며, Anthropic 공식가는 $0.100와 $0.500입니다. 프롬프트가 10만 토큰을 넘으면 요금은 $0.478와 $2.375입니다.
10만 토큰 요금표는 어떻게 적용되나요?
프롬프트 길이는 입력 토큰에 캐시 쓰기 토큰과 캐시 읽기 토큰을 더한 값입니다. 10만 토큰 이하이면 기본 요금이 적용됩니다. 10만 토큰을 넘으면 기준선을 넘은 토큰만이 아니라 입력, 출력, 캐시 쓰기, 캐시 읽기까지 요청 전체가 5배로 과금됩니다. 웹 검색 호출에는 배수가 적용되지 않습니다.
Claude Haiku 5.5가 Claude Haiku 4.5보다 저렴한가요?
Anthropic 공식 정가에서 Haiku 5.5는 10만 토큰 이하 프롬프트 기준 Haiku 4.5 요금의 10분의 1이고, 10만 토큰을 넘으면 절반입니다. Haiku 5.5는 같은 텍스트를 약 30% 더 많은 토큰으로 세는 새 토크나이저를 사용하고 사고가 기본으로 켜져 있으므로, 토큰 단가만 보지 말고 자신의 워크로드에서 완료된 작업의 비용을 비교하세요.
Claude Haiku 5.5 프롬프트 캐싱은 어떻게 과금되나요?
기본 요금표에서 EvoLink의 5분 캐시 쓰기는 100만 토큰당 $0.120, 캐시 읽기는 $0.011이며, Anthropic 공식 가격은 $0.125와 $0.010입니다. 둘은 따로 계량되고, 프롬프트가 10만 토큰을 넘으면 둘 다 5배로 과금됩니다. 워크로드 비용은 올림이 포함된 표시 요금으로 추정하세요.
Claude Haiku 5.5 웹 검색 도구는 어떻게 과금되나요?
web_search를 지원하는 라우트에서는 검색 1회당 $0.010입니다. 검색 결과 토큰은 일반 입력으로 과금됩니다. 연결 전에 라우트의 지원 여부를 확인하세요. 요금이 설정되어 있어도 모든 라우트에서 도구를 지원하는 것은 아닙니다.
Claude Haiku 5.5에서 사고를 끌 수 있나요?
네, high 이하 effort에서는 thinking: disabled를 보내면 됩니다. xhigh나 max에서는 Anthropic이 이를 거부하므로 effort 수준을 낮추거나 적응형 사고를 사용하세요. Anthropic은 사고를 끄는 대신 effort를 낮추기를 권장합니다. low effort에서는 모델이 간단한 요청의 사고를 건너뛸 수 있기 때문입니다.
Claude Haiku 5.5에서는 어떤 effort 수준을 써야 하나요?
기본값은 medium입니다. Anthropic은 채팅, 짧은 도구 작업, 단순한 대량 요청에는 low를, 에이전트 코딩을 포함한 대부분의 작업에는 medium을, 지식 업무와 엄격한 지시 준수에는 high를 제안합니다. xhigh와 max는 확정하기 전에 Claude Sonnet 5.5와 비교해 보세요.
Claude Haiku 4.5에서 이전하면 무엇이 바뀌나요?
모델 ID를 바꾸고, 사고 예산을 적응형 사고와 effort 수준으로 대체하고, temperature, top_p, top_k를 제거하고, 어시스턴트 프리필을 대체하세요. 사고가 기본으로 켜져 있으므로 content를 블록 유형별로 읽고 작은 max_tokens 값을 다시 검토하세요. 토크나이저는 같은 텍스트를 더 많은 토큰으로 세고, 컨텍스트는 100만 토큰으로, 최대 출력은 12.8만 토큰으로 늘어나며, Claude API에서 computer use를 쓰려면 computer toolset이 필요합니다.
짧은 분류 요청이 텍스트 없이 max_tokens에서 멈추는 이유는 무엇인가요?
사고는 max_tokens에 포함됩니다. 한 단어 답변에 맞춘 상한은 사고만으로 소진될 수 있고, 그러면 응답은 thinking 블록 뒤, 텍스트가 나오기 전에 끝납니다. 사고를 위한 여유가 생기도록 max_tokens를 높이거나 effort 수준을 낮추세요.
Claude Haiku 5.5의 거부 응답은 어떤 모습인가요?
안전 분류기가 요청을 거절할 수 있습니다. 응답은 stop_reason이 "refusal"이고 카테고리가 붙은 정상적인 성공 응답이므로, content를 읽기 전에 stop_reason을 확인하세요. Anthropic은 거절된 Haiku 5.5 요청을 다른 모델로 다시 처리해 주지 않습니다. 클라이언트에서 거부를 처리하고 다른 프롬프트를 시도하세요.
Claude Haiku 5.5에서 어떤 프로토콜과 SDK를 쓸 수 있나요?
같은 EvoLink API 키로 OpenAI 호환 Chat Completions 엔드포인트나 Anthropic Messages 엔드포인트를 사용하세요. Claude Code 등 Anthropic 네이티브 클라이언트는 base URL을 EvoLink로 지정하면 됩니다.
Claude Code 구독의 사용 한도가 EvoLink의 Claude Haiku 5.5 API에도 적용되나요?
Claude 구독 할당량과 EvoLink API 과금은 별개입니다. EvoLink 요청은 표시된 요금에 따라 EvoLink 잔액에서 과금되며 계정 및 라우트 한도는 계속 적용됩니다. 호환 클라이언트에서 EvoLink API 키와 문서에 명시된 엔드포인트를 설정하세요.
Claude Haiku 5.5의 컨텍스트 윈도와 최대 출력은 얼마인가요?
EvoLink 라우트는 1,000,000 토큰 컨텍스트 윈도와 응답당 최대 12.8만 출력 토큰을 기록합니다. 사고는 max_tokens에 포함되며, 10만 토큰을 넘는 프롬프트는 더 높은 요금표로 과금됩니다.
프로덕션에서 Claude Haiku 5.5를 평가할 때 무엇을 측정해야 하나요?
첫 시도 성공률, 유효한 구조화된 출력, 재시도, 작업당 모델 요청 수, 선택한 effort에서의 출력 토큰, 캐시 적중률, 프롬프트가 10만 토큰을 넘는 요청의 비율, 채택된 결과까지 걸린 시간, 사람의 수정량을 추적하고 토큰 단가만 보지 마세요.