Inicio / Modelos

Catálogo de modelos

Claude y GPT al 66% de las tarifas oficiales · DeepSeek y Kimi K3 al 88% · GLM desde el 70% · Qwen a tarifa oficial. Los descuentos son una política, no una promoción — verifica los modelos en vivo con GET /v1/models.

Catálogo de modelos

Todos los modelos principales con una sola clave

Claude para razonamiento, DeepSeek para código, Qwen para precio, Kimi y GLM para flujos multilingües. Claude y GPT se facturan al 66% de las tarifas oficiales; otros modelos principales con descuentos competitivos. Lista en vivo por clave en GET /v1/models.

OpenAI GPT
GPT-5.5 · rutas Codex

GPT-5.5 para razonamiento insignia y rutas de código ajustadas para Codex dentro del ecosistema de agentes de OpenAI — formatos Responses y Chat.

GPT-5.5 · insignia
Codex · rutas de código
DisponibleAPI Responses
Claude
Anthropic · trío frontera

Opus 5: «inteligencia frontera de Fable 5 a mitad de precio». Sonnet 5: «el Sonnet más agéntico hasta ahora». Haiku 4.5: el Claude más rápido y económico — SWE-bench 73,3%.

Opus 5 · 1M ctx
Fable 5 · 1M ctx
Sonnet 5 · 1M ctx
Haiku 4.5 · 200K
Disponible
Kimi
Moonshot · contexto largo

«El primer modelo abierto de clase 3T del mundo»: 2,8T de parámetros, visión nativa, ventana de 1M de tokens, diseñado para código y trabajo de conocimiento de largo horizonte.

Kimi K3
Disponible
GLM
Zhipu · multilingüe

GLM-5.3: «todas las mejoras vienen del post-entrenamiento» — código +50% frente a 5.2, SOTA en pesos abiertos. GLM-5.2: insignia abierto con licencia MIT y contexto real de 1M.

GLM-5.3
GLM-5.3 Flash
GLM-5.2
Disponible
DeepSeek
DeepSeek · precio

V4-Pro (1,6T / 49B activos): «rendimiento que rivaliza con los mejores modelos cerrados del mundo». V4-Flash (284B / 13B): rápido, eficiente y económico. Contexto nativo de 1M.

V4 Pro / V4 Flash
Disponible
Qwen
Alibaba · precio y visión

3.8-Max: MoE abierto de 2,4T de parámetros que «programa y entrega proyectos completos de más de 10 días». 3.8-Flash: 6B activos por token con contexto de 1M. VL para visión.

3.8 Max / Flash
3-VL Plus · visión
Disponible
¿Tu stack es el siguiente?
Listo para GPT-5.5 / Codex

Hoja de ruta multiproveedor — cuéntanos qué necesitas por Telegram.

Cómo se factura el uso

Por uso, medido por llamada. Sin suscripción, los créditos no caducan.

Tokens de entrada 1×
Prompt y contexto enviados al modelo. Se factura a la tarifa publicada de cada modelo — Claude y GPT al 66% de las tarifas oficiales, otros modelos principales a tarifa oficial.
Tokens de salida 5× input
Texto generado. La mayoría de modelos factura la salida a 5× la tarifa de entrada (DeepSeek 2×). Las respuestas en streaming cuentan igual que sin streaming.
Acierto de caché (lectura) 0.1× input
Contexto reutilizado de la caché de prompt del proveedor — se cobra al 10% de la tarifa de entrada. Mantén estable tu system prompt para acertar en caché; es el mayor ahorro de coste.
Escritura en caché 1.25× input
Almacenar contexto para reutilizarlo (modelos Claude). Se cobra una vez al 125% de la tarifa de entrada, y luego las lecturas son al 10%.
Tokens de razonamiento = output
Los tokens de razonamiento de los modelos con pensamiento extendido se facturan igual que los de salida: sin multiplicador oculto.
Descuentos permanentes
Los descuentos son política, no promociones: Claude y GPT al 66% de las tarifas oficiales; DeepSeek · Kimi · GLM · Qwen a tarifa oficial. No caducan ni dependen de una ventana promocional.

Cada llamada se detalla en la consola: tokens de entrada, salida, caché y razonamiento por petición. Verifica las tarifas en vivo con GET /v1/models.