1 · 어떤 모델을 골라야 할까요?
2026년에는 단일한 “최고의 모델”은 없습니다 — 최고의 적합성이 있을 뿐입니다. 가장 빠른 선택 방법은 작업 유형별로 고르는 것입니다:
| 작업 유형 | 선택 | 이유 |
|---|---|---|
| 가장 어려운 추론 연구, 수학, 아키텍처 | Claude Opus 5 / GLM-5.3 | 가장 깊은 chain-of-thought 품질; Opus 5는 1M token 컨텍스트 윈도우를 완전히 지원합니다. |
| 일상적 코딩 IDE 에이전트, code review | Claude Sonnet 5 / DeepSeek V4 | Claude Code 및 Codex 같은 도구에서 최고의 속도 대비 품질 균형; DeepSeek V4는 open-weights 가성비 선택입니다. |
| 대량 처리 분류, 추출, 배치 | Haiku 4.5 / DeepSeek V4 Flash / Qwen 3.8 Flash | 뛰어난 지시 수행으로 비용은 일부만. |
| 다국어 워크플로 CJK 콘텐츠, 긴 문서, 현지화 | Qwen 3.8 / Kimi K3 / GLM | 가장 강력한 CJK 이해 및 생성; Kimi는 매우 긴 컨텍스트에 탁월합니다. |
| Vision / 멀티모달 | Qwen 3-VL Plus | 플래그십 vision 가격의 일부로 이미지 이해. |
| Codex / GPT 생태계 | GPT-5.5 / 5.4 | OpenAI 기반 에이전트 프레임워크에 최적. |
경험칙: 실제 작업에는 중간 등급(Sonnet 5 / DeepSeek V4)으로 시작하고, 작업이 어렵다고 판명될 때만 Opus급으로 올리며, 반복적인 모든 작업에는 Haiku/Flash급으로 낮추세요. 청구 금액은 약 10× 줄어들고, 품질 손실은 대개 없습니다.
2 · 하나의 gateway, 세 개의 프로토콜
Model API는 서로 다른 wire 포맷을 사용합니다. ThunderPeak은 이들을 모두 하나의 키와 하나의 잔액 뒤에 노출합니다:
| 프로토콜 | Endpoint | 사용처 |
|---|---|---|
| OpenAI Chat Completions | /v1/chat/completions | OpenAI SDK, Cherry Studio, 대부분의 도구 |
| Anthropic Messages | /v1/messages | Claude Code, Anthropic SDK, Cursor |
| Responses | /v1/responses | Codex CLI & extension, 최신 OpenAI SDK |
OpenAI 호환 도구를 https://thunder-peak.com/v1로, 또는 Anthropic 도구를 https://thunder-peak.com로 지정하세요 — 동일한 키가 둘 다에서 작동합니다. 서드파티 클라이언트가 경로 오류를 보고하면 /v1을 덧붙이세요.
3 · 청구 금액은 어떻게 계산될까요
모든 요청은 다섯 가지 token 카테고리를 측정합니다 — 이는 제공업체가 사용하는 것과 동일한 모델이므로, 저희의 token당 가격은 예상과 1:1로 대응합니다:
| 카테고리 | 의미 | 상대 비용 |
|---|---|---|
| 입력 token | 프롬프트, system prompt, 도구 정의 | 1× |
| 출력 token | 생성된 답변 | 일반적으로 입력의 5× |
| Cache 쓰기 | 프롬프트 접두사가 처음 캐시될 때 | 입력의 1.25× |
| Cache 읽기 | 캐시된 접두사 재사용(반복 프롬프트) | 입력의 0.1× — 가장 큰 절감 수단 |
| Thinking token | 숨겨진 추론(Opus/Sonnet/thinking 모델) | 출력 요율 적용 |
실용 팁: cache 읽기를 최대화하려면 system prompt를 안정적으로 유지하세요(새 입력보다 10× 저렴); streaming은 non-streaming과 비용이 같습니다; 대시보드의 사용 내역은 모든 요청을 token 단위까지 세분화합니다.
4 · 왜 굳이 gateway를 거칠까요?
5 · 용어집
| 용어 | 쉬운 의미 |
|---|---|
| API key | 비밀 자격 증명; 다음과 같이 전송하세요 Authorization: Bearer sk-tp-… |
| Base URL | 도구에 붙여넣는 gateway 주소, 예: https://thunder-peak.com/v1 |
| 컨텍스트 윈도우 | 모델이 요청당 볼 수 있는 최대 token(예: 1M ≈ 코드베이스 전체) |
| SSE / streaming | token 단위 출력; 채팅 및 에이전트 UI를 즉각적으로 느껴지게 하는 것 |
| 도구 호출 (tool calling) | 모델이 앱에 함수 실행을 요청하는 것 — 에이전트의 기반 |
| 추론 / thinking | 답변 전에 "생각"하는 모델; 더 강력하지만 token당 더 비쌉니다 |
| Rate limit | 키당 허용되는 분당 요청 수 — ThunderPeak에서 키별로 구성 가능 |