1 · Какую модель выбрать?
В 2026 году нет единственной «лучшей модели» — есть лучшие подходящие варианты. Быстрее всего выбирать по типу задачи:
| Задача | Выбор | Почему |
|---|---|---|
| Сложнейшие рассуждения исследования, математика, архитектура | Claude Opus 5 / GLM-5.3 | Самое глубокое качество цепочки рассуждений; Opus 5 несёт полное контекстное окно на 1M токенов. |
| Ежедневное программирование агенты в IDE, code review | Claude Sonnet 5 / DeepSeek V4 | Лучший баланс скорости и качества в таких инструментах, как Claude Code и Codex; DeepSeek V4 — выгодный выбор с открытыми весами. |
| Большие объёмы классификация, извлечение, пакетная обработка | Haiku 4.5 / DeepSeek V4 Flash / Qwen 3.8 Flash | Доля стоимости при хорошем следовании инструкциям. |
| Мультиязычные задачи контент на CJK, длинные документы, локализация | Qwen 3.8 / Kimi K3 / GLM | Сильнейшее понимание и генерация CJK; Kimi превосходит в очень длинном контексте. |
| Vision / мультимодальность | Qwen 3-VL Plus | Понимание изображений за долю стоимости флагманского vision. |
| Экосистема Codex / GPT | GPT-5.5 / 5.4 | Нативное соответствие агентным фреймворкам, ориентированным на OpenAI. |
Практическое правило: начинайте со среднего уровня (Sonnet 5 / DeepSeek V4) для реальной работы, переходите на класс Opus только когда задача окажется сложной, и опускайтесь до класса Haiku/Flash для всего повторяющегося. Ваш счёт уменьшается ~10×, а потеря качества часто нулевая.
2 · Один шлюз — три протокола
Model API говорят на разных форматах. ThunderPeak открывает их все за одним ключом и одним балансом:
| Протокол | Endpoint | Используется в |
|---|---|---|
| OpenAI Chat Completions | /v1/chat/completions | OpenAI SDK, Cherry Studio, большинство инструментов |
| Anthropic Messages | /v1/messages | Claude Code, Anthropic SDK, Cursor |
| Responses | /v1/responses | Codex CLI и расширение, новые OpenAI SDK |
Направьте OpenAI-совместимый инструмент на https://thunder-peak.com/v1, а Anthropic-инструмент — на https://thunder-peak.com — один и тот же ключ работает с обоими. Если сторонний клиент сообщает об ошибке пути, добавьте /v1.
3 · Как рассчитывается счёт
Каждый запрос учитывает пять категорий токенов — это та же модель, что используют провайдеры, поэтому наши цены за токен соответствуют 1:1 ожидаемым:
| Категория | Значение | Относительная стоимость |
|---|---|---|
| Входные токены | Ваш промпт, system prompt, определения инструментов | 1× |
| Выходные токены | Сгенерированный ответ | обычно 5× входных |
| Запись в cache | Первое кэширование префикса промпта | 1.25× входных |
| Чтение из cache | Повторное использование кэшированного префикса (повторные промпты) | 0.1× входных — главный рычаг экономии |
| Токены размышления | Скрытые рассуждения (модели Opus/Sonnet/thinking) | по цене выходных |
Практические советы: держите system prompt стабильным, чтобы максимизировать чтения из cache (в 10× дешевле свежего ввода); streaming стоит столько же, сколько обычный режим; а история использования в панели разбивает каждый запрос вплоть до токена.
4 · Зачем вообще маршрутизировать через шлюз?
5 · Глоссарий
| Термин | Простое значение |
|---|---|
| API key | Ваш секретный ключ; передавайте его как Authorization: Bearer sk-tp-… |
| Base URL | Адрес шлюза, который вы вставляете в инструмент, например https://thunder-peak.com/v1 |
| Контекстное окно | Максимум токенов, которые модель видит за запрос (напр. 1M ≈ целая кодовая база) |
| SSE / streaming | Вывод токен за токеном; именно это делает чат и агентные интерфейсы мгновенными |
| Вызов инструментов (tool calling) | Модель просит ваше приложение выполнить функции — основа агентов |
| Рассуждения / thinking | Модели, которые «думают» перед ответом; сильнее, но дороже за токен |
| Rate limit | Запросов в минуту на ключ — настраивается для каждого ключа в ThunderPeak |