1 · Qual modelo devo escolher?
Não existe um único «melhor modelo» em 2026 — existem os melhores encaixes. A forma mais rápida de escolher é por tipo de carga:
| Carga de trabalho | Escolha | Por quê |
|---|---|---|
| Raciocínio mais difícil pesquisa, matemática, arquitetura | Claude Opus 5 / GLM-5.3 | A maior profundidade de cadeia de pensamento; o Opus 5 traz janela completa de 1M de tokens. |
| Código diário agentes de IDE, revisão de código | Claude Sonnet 5 / DeepSeek V4 | O melhor equilíbrio velocidade-qualidade em ferramentas como Claude Code e Codex; o DeepSeek V4 é a opção econômica de pesos abertos. |
| Grande volume classificação, extração, lote | Haiku 4.5 / DeepSeek V4 Flash / Qwen 3.8 Flash | Uma fração do custo com bom seguimento de instruções. |
| Fluxos multilíngues conteúdo CJK, documentos longos, localização | Qwen 3.8 / Kimi K3 / GLM | A melhor compreensão e geração em CJK; o Kimi se destaca em contexto muito longo. |
| Visão / multimodal | Qwen 3-VL Plus | Compreensão de imagens por uma fração do preço da visão de ponta. |
| Ecossistema Codex / GPT | GPT-5.5 / 5.4 | Encaixe nativo com frameworks de agentes alinhados à OpenAI. |
Regra prática: comece pela faixa intermediária (Sonnet 5 / DeepSeek V4) para trabalho real, suba para a classe Opus só quando a tarefa se mostrar difícil e caia para a classe Haiku/Flash no que for repetitivo. Sua fatura cai ~10× e a perda de qualidade costuma ser zero.
2 · Um gateway, três protocolos
As APIs de modelos falam formatos diferentes. O ThunderPeak expõe todos atrás de uma chave e um saldo:
| Protocolo | Endpoint | Usado por |
|---|---|---|
| OpenAI Chat Completions | /v1/chat/completions | SDK da OpenAI, Cherry Studio, a maioria das ferramentas |
| Anthropic Messages | /v1/messages | Claude Code, SDK da Anthropic, Cursor |
| Responses | /v1/responses | Codex CLI e extensão, SDKs mais recentes da OpenAI |
Aponte uma ferramenta compatível com OpenAI para https://thunder-peak.com/v1, ou uma ferramenta da Anthropic para https://thunder-peak.com — a mesma chave serve para ambos. Se um cliente de terceiros der erro de caminho, acrescente /v1.
3 · Como a fatura é calculada
Cada requisição mede cinco categorias de tokens — é o mesmo modelo que os provedores usam, então nossos preços por token correspondem 1:1 ao esperado:
| Categoria | Significado | Custo relativo |
|---|---|---|
| Tokens de entrada | Seu prompt, system prompt e definições de ferramentas | 1× |
| Tokens de saída | A resposta gerada | normalmente 5× a entrada |
| Escrita em cache | Primeira vez que um prefixo do prompt é cacheado | 1,25× a entrada |
| Leitura de cache | Reutilizar um prefixo em cache (prompts repetidos) | 0,1× a entrada — a maior alavanca |
| Tokens de raciocínio | Raciocínio oculto (Opus/Sonnet/modelos com pensamento) | ao preço de saída |
Dicas práticas: mantenha o system prompt estável para maximizar as leituras de cache (10× mais baratas que a entrada nova); streaming custa o mesmo que sem streaming; e o histórico do painel detalha cada requisição até o token.
4 · Por que passar por um gateway?
5 · Glossário
| Termo | Significado simples |
|---|---|
| Chave de API | Sua credencial secreta; envie como Authorization: Bearer sk-tp-… |
| Base URL | O endereço do gateway que você cola numa ferramenta, por exemplo https://thunder-peak.com/v1 |
| Janela de contexto | Máximo de tokens que o modelo vê por requisição (ex.: 1M ≈ um codebase inteiro) |
| SSE / streaming | Saída token a token; o que faz chats e agentes parecerem instantâneos |
| Chamada de ferramentas | O modelo pedindo que seu app execute funções — a base dos agentes |
| Raciocínio / pensamento | Modelos que «pensam» antes de responder; mais fortes, porém mais caros por token |
| Limite de taxa | Requisições por minuto por chave — configurável por chave no ThunderPeak |