Início / Modelos

Catálogo de modelos

Claude e GPT a 66% das tarifas oficiais · DeepSeek e Kimi K3 a 88% · GLM a partir de 70% · Qwen na tarifa oficial. Os descontos são política, não promoção — verifique os modelos ao vivo com GET /v1/models.

Catálogo de modelos

Todos os modelos principais com uma única chave

Claude para raciocínio, DeepSeek para código, Qwen para custo, Kimi e GLM para fluxos multilíngues. Claude e GPT são cobrados a 66% das tarifas oficiais; outros modelos principais com descontos competitivos. Lista ao vivo por chave em GET /v1/models.

OpenAI GPT
GPT-5.5 · rotas Codex

GPT-5.5 para raciocínio de ponta e rotas de código ajustadas para o Codex no ecossistema de agentes da OpenAI — formatos Responses e Chat.

GPT-5.5 · ponta
Codex · rotas de código
DisponívelAPI Responses
Claude
Anthropic · trio de ponta

Opus 5: «inteligência de ponta do Fable 5 pela metade do preço». Sonnet 5: «o Sonnet mais agêntico até agora». Haiku 4.5: o Claude mais rápido e barato — SWE-bench 73,3%.

Opus 5 · 1M ctx
Fable 5 · 1M ctx
Sonnet 5 · 1M ctx
Haiku 4.5 · 200K
Disponível
Kimi
Moonshot · contexto longo

«O primeiro modelo aberto da classe 3T do mundo» — 2,8T de parâmetros, visão nativa, janela de 1M de tokens, projetado para código e trabalho de conhecimento de longo prazo.

Kimi K3
Disponível
GLM
Zhipu · multilíngue

GLM-5.3: «todos os ganhos vêm do pós-treinamento» — código +50% em relação ao 5.2, SOTA em pesos abertos. GLM-5.2: carro-chefe aberto sob licença MIT com contexto real de 1M.

GLM-5.3
GLM-5.3 Flash
GLM-5.2
Disponível
DeepSeek
DeepSeek · custo

V4-Pro (1,6T / 49B ativos): «desempenho que rivaliza com os melhores modelos fechados do mundo». V4-Flash (284B / 13B): rápido, eficiente e econômico. Contexto nativo de 1M.

V4 Pro / V4 Flash
Disponível
Qwen
Alibaba · custo e visão

3.8-Max: MoE aberto de 2,4T de parâmetros que «programa e entrega projetos completos de mais de 10 dias». 3.8-Flash: 6B ativos por token com contexto de 1M. VL para visão.

3.8 Max / Flash
3-VL Plus · visão
Disponível
Seu stack é o próximo?
Pronto para GPT-5.5 / Codex

Roadmap multiprovedor — diga o que você precisa pelo Telegram.

Como o uso é cobrado

Por uso, medido por chamada. Sem assinatura, os créditos não expiram.

Tokens de entrada 1×
Prompt e contexto enviados ao modelo. Cobrado pela tarifa publicada de cada modelo — Claude e GPT a 66% das tarifas oficiais, outros modelos principais na tarifa oficial.
Tokens de saída 5× input
Texto gerado. A maioria dos modelos cobra a saída a 5× a tarifa de entrada (DeepSeek 2×). Respostas em streaming contam igual às sem streaming.
Acerto de cache (leitura) 0.1× input
Contexto reutilizado do cache de prompt do provedor — cobrado a 10% da tarifa de entrada. Mantenha o system prompt estável para acertar o cache; é a maior economia de custo.
Escrita em cache 1.25× input
Armazenar contexto para reutilização (modelos Claude). Cobrado uma vez a 125% da tarifa de entrada, e depois as leituras ficam em 10%.
Tokens de raciocínio = output
Tokens de raciocínio de modelos com pensamento estendido são cobrados exatamente como tokens de saída — sem multiplicador oculto.
Descontos permanentes
Os descontos são política, não promoção: Claude e GPT a 66% das tarifas oficiais; DeepSeek · Kimi · GLM · Qwen na tarifa oficial. Não expiram e não dependem de janela promocional.

Cada chamada é detalhada no console — tokens de entrada, saída, cache e raciocínio por requisição. Verifique as tarifas ao vivo com GET /v1/models.