Accueil / Modèles

Catalogue de modèles

Claude et GPT à 66% des tarifs officiels · DeepSeek et Kimi K3 à 88% · GLM à partir de 70% · Qwen au tarif officiel. Les remises sont une politique, pas une promotion — vérifiez les modèles en direct avec GET /v1/models.

Catalogue de modèles

Tous les grands modèles avec une seule clé

Claude pour le raisonnement, DeepSeek pour le code, Qwen pour le prix, Kimi et GLM pour les workflows multilingues. Claude et GPT facturés à 66% des tarifs officiels ; les autres grands modèles à des remises compétitives. Liste en direct par clé sur GET /v1/models.

OpenAI GPT
GPT-5.5 · routes Codex

GPT-5.5 pour le raisonnement phare et des routes de code optimisées Codex dans l’écosystème d’agents OpenAI — formats Responses et Chat.

GPT-5.5 · phare
Codex · routes de code
DisponibleAPI Responses
Claude
Anthropic · trio de pointe

Opus 5 : « l’intelligence de pointe de Fable 5 à moitié prix ». Sonnet 5 : « le Sonnet le plus agentique à ce jour ». Haiku 4.5 : le Claude le plus rapide et le moins cher — SWE-bench 73,3 %.

Opus 5 · 1M ctx
Fable 5 · 1M ctx
Sonnet 5 · 1M ctx
Haiku 4.5 · 200K
Disponible
Kimi
Moonshot · contexte long

« Le premier modèle ouvert de classe 3T au monde » — 2,8T de paramètres, vision native, fenêtre de 1M de tokens, conçu pour le code et le travail de connaissance sur le long terme.

Kimi K3
Disponible
GLM
Zhipu · multilingue

GLM-5.3 : « tous les gains viennent du post-entraînement » — code +50 % vs 5.2, SOTA en poids ouverts. GLM-5.2 : modèle phare ouvert sous licence MIT avec un vrai contexte 1M.

GLM-5.3
GLM-5.3 Flash
GLM-5.2
Disponible
DeepSeek
DeepSeek · rapport qualité-prix

V4-Pro (1,6T / 49B actifs) : « des performances rivalisant avec les meilleurs modèles propriétaires ». V4-Flash (284B / 13B) : rapide, efficace et économique. Contexte natif de 1M.

V4 Pro / V4 Flash
Disponible
Qwen
Alibaba · prix et vision

3.8-Max : MoE ouvert de 2,4T de paramètres qui « code et livre des projets complets sur plus de 10 jours ». 3.8-Flash : 6B actifs par token avec contexte 1M. VL pour la vision.

3.8 Max / Flash
3-VL Plus · vision
Disponible
Votre stack est le prochain ?
Prêt pour GPT-5.5 / Codex

Feuille de route multi-fournisseurs — dites-nous ce dont vous avez besoin sur Telegram.

Comment l’usage est facturé

À l’usage, mesuré par appel. Sans abonnement, les crédits n’expirent jamais.

Tokens d’entrée 1×
Prompt et contexte envoyés au modèle. Facturés au tarif publié de chaque modèle — Claude et GPT à 66% des tarifs officiels, les autres grands modèles au tarif officiel.
Tokens de sortie 5× input
Texte généré. La plupart des modèles facturent la sortie à 5× le tarif d’entrée (DeepSeek 2×). Les réponses en streaming comptent comme celles sans streaming.
Cache touché (lecture) 0.1× input
Contexte réutilisé depuis le cache de prompt du fournisseur — facturé à 10 % du tarif d’entrée. Gardez un system prompt stable pour toucher le cache : c’est la plus grosse économie.
Écriture de cache 1.25× input
Stockage du contexte pour réutilisation (modèles Claude). Facturé une fois à 125 % du tarif d’entrée, puis les lectures sont à 10 %.
Tokens de raisonnement = output
Les tokens de raisonnement des modèles à réflexion étendue sont facturés exactement comme les tokens de sortie — sans multiplicateur caché.
Remises permanentes
Les remises sont une politique, pas des promotions : Claude et GPT à 66 % des tarifs officiels ; DeepSeek · Kimi · GLM · Qwen au tarif officiel. Elles n’expirent pas et ne dépendent d’aucune fenêtre promotionnelle.

Chaque appel est détaillé dans la console — tokens d’entrée, de sortie, de cache et de raisonnement par requête. Vérifiez les tarifs en direct avec GET /v1/models.