Todos os modelos principais com uma única chave
Claude para raciocínio, DeepSeek para código, Qwen para custo, Kimi e GLM para fluxos multilíngues. Claude e GPT são cobrados a 66% das tarifas oficiais; outros modelos principais com descontos competitivos. Lista ao vivo por chave em GET /v1/models.
GPT-5.5 para raciocínio de ponta e rotas de código ajustadas para o Codex no ecossistema de agentes da OpenAI — formatos Responses e Chat.
Opus 5: «inteligência de ponta do Fable 5 pela metade do preço». Sonnet 5: «o Sonnet mais agêntico até agora». Haiku 4.5: o Claude mais rápido e barato — SWE-bench 73,3%.
«O primeiro modelo aberto da classe 3T do mundo» — 2,8T de parâmetros, visão nativa, janela de 1M de tokens, projetado para código e trabalho de conhecimento de longo prazo.
GLM-5.3: «todos os ganhos vêm do pós-treinamento» — código +50% em relação ao 5.2, SOTA em pesos abertos. GLM-5.2: carro-chefe aberto sob licença MIT com contexto real de 1M.
V4-Pro (1,6T / 49B ativos): «desempenho que rivaliza com os melhores modelos fechados do mundo». V4-Flash (284B / 13B): rápido, eficiente e econômico. Contexto nativo de 1M.
3.8-Max: MoE aberto de 2,4T de parâmetros que «programa e entrega projetos completos de mais de 10 dias». 3.8-Flash: 6B ativos por token com contexto de 1M. VL para visão.
Roadmap multiprovedor — diga o que você precisa pelo Telegram.
Como o uso é cobrado
Por uso, medido por chamada. Sem assinatura, os créditos não expiram.
Cada chamada é detalhada no console — tokens de entrada, saída, cache e raciocínio por requisição. Verifique as tarifas ao vivo com GET /v1/models.