Главная / Модели

Каталог моделей

Claude и GPT по 66% от официальных цен · DeepSeek и Kimi K3 — 88% · GLM от 70% · Qwen по официальным. Скидки — политика, а не акция — проверяйте актуальные модели через GET /v1/models.

Каталог моделей

Все ведущие модели по одному ключу

Claude для рассуждений, DeepSeek для кода, Qwen для экономии, Kimi и GLM для мультиязычных задач. Claude и GPT тарифицируются по 66% от официальных цен; другие ведущие модели — с конкурентными скидками. Актуальный список для ключа через GET /v1/models.

OpenAI GPT
GPT-5.5 · маршруты Codex

Флагманские рассуждения GPT-5.5 и маршруты кодинга, настроенные под Codex, для агентной экосистемы OpenAI — форматы Responses и Chat.

GPT-5.5 · флагман
Codex · маршруты для кода
В сетиResponses API
Claude
Anthropic · трио флагманов

Opus 5: «передовой интеллект Fable 5 за полцены». Sonnet 5: «самый агентный Sonnet на сегодня». Haiku 4.5: самый быстрый и дешёвый Claude — SWE-bench 73.3%.

Opus 5 · 1M ctx
Fable 5 · 1M ctx
Sonnet 5 · 1M ctx
Haiku 4.5 · 200K
Онлайн
Kimi
Moonshot · длинный контекст

«Первая в мире открытая модель класса 3T» — 2.8T параметров, нативный vision, окно 1M токенов, создана для долгосрочной работы с кодом и знаниями.

Kimi K3
Онлайн
GLM
Zhipu · мультиязычность

GLM-5.3: «весь прирост — от пост-тренировки» — кодинг +50% против 5.2, SOTA с открытыми весами. GLM-5.2: открытый флагман под лицензией MIT на настоящем контексте 1M.

GLM-5.3
GLM-5.3 Flash
GLM-5.2
Онлайн
DeepSeek
DeepSeek · цена

V4-Pro (1.6T / 49B активных): «производительность на уровне лучших закрытых моделей мира». V4-Flash (284B / 13B): быстрая, эффективная и экономичная. Нативный контекст 1M.

V4 Pro / V4 Flash
Онлайн
Qwen
Alibaba · цена и vision

3.8-Max: открытая MoE с 2.4T параметров, которая «пишет код и доводит до конца целые проекты на 10+ дней». 3.8-Flash: 6B активных на токен с контекстом 1M. VL для vision.

3.8 Max / Flash
3-VL Plus · vision
Онлайн
Ваш стек следующий?
GPT-5.5 / Codex готовы

Дорожная карта мультипровайдеров — расскажите, что вам нужно, в Telegram.

Как тарифицируется использование

По факту использования, с оплатой за вызов. Без подписки, кредиты не сгорают.

Входные токены
Промпт и контекст, отправленные модели. Тарифицируется по опубликованной ставке каждой модели — Claude и GPT по 66% от официальных цен, другие ведущие модели по официальным.
Выходные токены 5× входных
Сгенерированный текст. Большинство моделей тарифицируют вывод в 5× от ставки ввода (DeepSeek 2×). Потоковые ответы считаются так же, как обычные.
Попадание в cache (чтение) 0.1× входных
Повторно используемый контекст из prompt cache провайдера — тарифицируется по 10% от ставки ввода. Держите system prompt стабильным, чтобы попадать в cache; это самый большой способ экономии.
Запись в cache 1.25× входных
Сохранение контекста для повторного использования (модели Claude). Списывается один раз по 125% от ставки ввода, затем чтения — 10%.
Токены размышления = выходные
Токены рассуждений от моделей с extended-thinking тарифицируются точно как выходные токены — без скрытых множителей.
Скидки постоянные
Скидки — это политика, а не акции: Claude и GPT по 66% от официальных цен; DeepSeek · Kimi · GLM · Qwen по официальным. Они не истекают и не привязаны к промо-периоду.

Каждый вызов детализирован в консоли — входные и выходные токены, cache и токены размышления по каждому запросу. Проверяйте актуальные ставки через GET /v1/models.