1 · ¿Qué modelo debo elegir?
En 2026 no existe un único «mejor modelo» — existen los mejores encajes. La forma más rápida de elegir es por tipo de carga:
| Carga de trabajo | Elige | Por qué |
|---|---|---|
| Razonamiento más difícil investigación, matemáticas, arquitectura | Claude Opus 5 / GLM-5.3 | La mayor profundidad de cadena de pensamiento; Opus 5 lleva una ventana de contexto completa de 1M de tokens. |
| Código diario agentes de IDE, revisión de código | Claude Sonnet 5 / DeepSeek V4 | El mejor equilibrio velocidad-calidad en herramientas como Claude Code y Codex; DeepSeek V4 es la opción económica de pesos abiertos. |
| Gran volumen clasificación, extracción, lotes | Haiku 4.5 / DeepSeek V4 Flash / Qwen 3.8 Flash | Una fracción del coste con buen seguimiento de instrucciones. |
| Flujos multilingües contenido CJK, documentos largos, localización | Qwen 3.8 / Kimi K3 / GLM | La mejor comprensión y generación en CJK; Kimi destaca en contexto muy largo. |
| Visión / multimodal | Qwen 3-VL Plus | Comprensión de imágenes por una fracción del precio de la visión insignia. |
| Ecosistema Codex / GPT | GPT-5.5 / 5.4 | Encaje nativo con frameworks de agentes alineados con OpenAI. |
Regla práctica: empieza con la gama media (Sonnet 5 / DeepSeek V4) para trabajo real, sube a la clase Opus solo cuando la tarea se demuestre difícil y baja a la clase Haiku/Flash para lo repetitivo. Tu factura se reduce ~10× y la pérdida de calidad suele ser cero.
2 · Una pasarela, tres protocolos
Las API de modelos hablan formatos distintos. ThunderPeak los expone todos tras una clave y un saldo:
| Protocolo | Endpoint | Usado por |
|---|---|---|
| OpenAI Chat Completions | /v1/chat/completions | SDK de OpenAI, Cherry Studio, la mayoría de herramientas |
| Anthropic Messages | /v1/messages | Claude Code, SDK de Anthropic, Cursor |
| Responses | /v1/responses | Codex CLI y su extensión, SDK de OpenAI más recientes |
Apunta una herramienta compatible con OpenAI a https://thunder-peak.com/v1, o una herramienta de Anthropic a https://thunder-peak.com — la misma clave sirve para ambos. Si un cliente de terceros da error de ruta, añade /v1.
3 · Cómo se calcula la factura
Cada petición mide cinco categorías de tokens — es el mismo modelo que usan los proveedores, así que nuestros precios por token corresponden 1:1 con lo esperado:
| Categoría | Significado | Coste relativo |
|---|---|---|
| Tokens de entrada | Tu prompt, system prompt y definiciones de herramientas | 1× |
| Tokens de salida | La respuesta generada | normalmente 5× la entrada |
| Escritura de caché | Primera vez que se cachea un prefijo del prompt | 1,25× la entrada |
| Lectura de caché | Reutilizar un prefijo en caché (prompts repetidos) | 0,1× la entrada — la mayor palanca |
| Tokens de razonamiento | Razonamiento oculto (Opus/Sonnet/modelos con pensamiento) | al precio de salida |
Consejos prácticos: mantén estable el system prompt para maximizar las lecturas de caché (10× más baratas que la entrada nueva); el streaming cuesta igual que sin streaming; y el historial del panel desglosa cada petición hasta el token.
4 · ¿Por qué pasar por una pasarela?
5 · Glosario
| Término | Significado claro |
|---|---|
| Clave de API | Tu credencial secreta; envíala como Authorization: Bearer sk-tp-… |
| Base URL | La dirección de la pasarela que pegas en una herramienta, p. ej. https://thunder-peak.com/v1 |
| Ventana de contexto | Máximo de tokens que el modelo ve por petición (p. ej. 1M ≈ todo un código base) |
| SSE / streaming | Salida token a token; lo que hace que los chats y agentes se sientan instantáneos |
| Llamada a herramientas | El modelo pidiendo a tu app ejecutar funciones — la base de los agentes |
| Razonamiento / pensamiento | Modelos que «piensan» antes de responder; más potentes pero más caros por token |
| Límite de velocidad | Peticiones por minuto permitidas por clave — configurable por clave en ThunderPeak |