1 · Quel modèle choisir ?
Il n’existe pas de « meilleur modèle » unique en 2026 — il existe les meilleurs ajustements. Le plus rapide est de choisir selon le type de charge :
| Charge de travail | Choisir | Pourquoi |
|---|---|---|
| Raisonnement le plus difficile recherche, maths, architecture | Claude Opus 5 / GLM-5.3 | La plus grande profondeur de chaîne de raisonnement ; Opus 5 offre une fenêtre de contexte complète de 1M de tokens. |
| Code quotidien agents d’IDE, revue de code | Claude Sonnet 5 / DeepSeek V4 | Le meilleur équilibre vitesse-qualité dans des outils comme Claude Code et Codex ; DeepSeek V4 est le choix économique à poids ouverts. |
| Gros volume classification, extraction, lots | Haiku 4.5 / DeepSeek V4 Flash / Qwen 3.8 Flash | Une fraction du coût avec un bon suivi des instructions. |
| Workflows multilingues contenu CJK, documents longs, localisation | Qwen 3.8 / Kimi K3 / GLM | La meilleure compréhension et génération CJK ; Kimi excelle sur le contexte très long. |
| Vision / multimodal | Qwen 3-VL Plus | Compréhension d’images pour une fraction du prix de la vision phare. |
| Écosystème Codex / GPT | GPT-5.5 / 5.4 | Intégration naturelle aux frameworks d’agents alignés OpenAI. |
Règle générale : commencez par la gamme intermédiaire (Sonnet 5 / DeepSeek V4) pour le vrai travail, montez en classe Opus seulement si la tâche se révèle difficile, et descendez en classe Haiku/Flash pour le répétitif. Votre facture est divisée par ~10, la perte de qualité est souvent nulle.
2 · Une passerelle, trois protocoles
Les API de modèles parlent des formats différents. ThunderPeak les expose tous derrière une clé et un solde :
| Protocole | Point de terminaison | Utilisé par |
|---|---|---|
| OpenAI Chat Completions | /v1/chat/completions | SDK OpenAI, Cherry Studio, la plupart des outils |
| Anthropic Messages | /v1/messages | Claude Code, SDK Anthropic, Cursor |
| Responses | /v1/responses | Codex CLI et son extension, SDK OpenAI récents |
Pointez un outil compatible OpenAI vers https://thunder-peak.com/v1, ou un outil Anthropic vers https://thunder-peak.com — la même clé fonctionne pour les deux. Si un client tiers signale une erreur de chemin, ajoutez /v1.
3 · Comment la facture est calculée
Chaque requête mesure cinq catégories de tokens — le même modèle que les fournisseurs, donc nos prix au token correspondent 1:1 à ce que vous attendez :
| Catégorie | Signification | Coût relatif |
|---|---|---|
| Tokens d’entrée | Votre prompt, le system prompt, les définitions d’outils | 1× |
| Tokens de sortie | La réponse générée | généralement 5× l’entrée |
| Écriture de cache | Première mise en cache d’un préfixe de prompt | 1,25× l’entrée |
| Lecture de cache | Réutiliser un préfixe en cache (prompts répétés) | 0,1× l’entrée — le plus grand levier |
| Tokens de raisonnement | Raisonnement caché (Opus/Sonnet/modèles à réflexion) | au prix de sortie |
Conseils pratiques : gardez un system prompt stable pour maximiser les lectures de cache (10× moins cher que l’entrée nouvelle) ; le streaming coûte comme le non-streaming ; et l’historique du tableau de bord détaille chaque requête jusqu’au token.
4 · Pourquoi passer par une passerelle ?
5 · Glossaire
| Terme | Signification simple |
|---|---|
| Clé API | Votre identifiant secret ; envoyez-le comme Authorization: Bearer sk-tp-… |
| URL de base | L’adresse de la passerelle que vous collez dans un outil, par ex. https://thunder-peak.com/v1 |
| Fenêtre de contexte | Tokens maximum visibles par requête (par ex. 1M ≈ tout un codebase) |
| SSE / streaming | Sortie token par token ; ce qui rend chats et agents instantanés |
| Appel d’outils | Le modèle demande à votre app d’exécuter des fonctions — la base des agents |
| Raisonnement / réflexion | Des modèles qui « réfléchissent » avant de répondre ; plus forts mais plus chers au token |
| Limite de débit | Requêtes par minute autorisées par clé — configurable par clé dans ThunderPeak |