1 · Welches Modell soll ich wählen?
Es gibt 2026 kein einzelnes „bestes Modell“ — es gibt die besten Passungen. Am schnellsten wählt man nach Arbeitslast:
| Arbeitslast | Wählen | Warum |
|---|---|---|
| Härtestes Reasoning Forschung, Mathematik, Architektur | Claude Opus 5 / GLM-5.3 | Tiefste Gedankenketten-Qualität; Opus 5 bringt ein volles 1-Mio.-Token-Kontextfenster. |
| Tägliches Coding IDE-Agenten, Code-Review | Claude Sonnet 5 / DeepSeek V4 | Beste Balance aus Tempo und Qualität in Tools wie Claude Code und Codex; DeepSeek V4 ist die preiswerte Open-Weights-Wahl. |
| Hohes Volumen Klassifizierung, Extraktion, Batch | Haiku 4.5 / DeepSeek V4 Flash / Qwen 3.8 Flash | Bruchteil der Kosten bei starker Instruktionsbefolgung. |
| Mehrsprachige Workflows CJK-Inhalte, lange Dokumente, Lokalisierung | Qwen 3.8 / Kimi K3 / GLM | Stärkstes CJK-Verständnis und -Generierung; Kimi glänzt bei sehr langem Kontext. |
| Vision / multimodal | Qwen 3-VL Plus | Bildverständnis zu einem Bruchteil der Flaggschiff-Vision-Preise. |
| Codex-/GPT-Ökosystem | GPT-5.5 / 5.4 | Native Passung für OpenAI-nahe Agent-Frameworks. |
Faustregel: für echte Arbeit mit der Mittelklasse (Sonnet 5 / DeepSeek V4) starten, nur bei nachweislich harten Aufgaben auf Opus-Klasse gehen und bei Wiederholungen auf Haiku/Flash-Klasse. Die Rechnung schrumpft ~10×, Qualitätsverlust ist oft null.
2 · Ein Gateway, drei Protokolle
Modell-APIs sprechen unterschiedliche Formate. ThunderPeak stellt sie alle hinter einem Schlüssel und einem Guthaben bereit:
| Protokoll | Endpunkt | Genutzt von |
|---|---|---|
| OpenAI Chat Completions | /v1/chat/completions | OpenAI-SDK, Cherry Studio, die meisten Tools |
| Anthropic Messages | /v1/messages | Claude Code, Anthropic-SDK, Cursor |
| Responses | /v1/responses | Codex CLI und Erweiterung, neuere OpenAI-SDKs |
Richten Sie ein OpenAI-kompatibles Tool auf https://thunder-peak.com/v1, oder ein Anthropic-Tool auf https://thunder-peak.com — derselbe Schlüssel gilt für beide. Meldet ein Drittanbieter-Client einen Pfadfehler, hängen Sie an /v1.
3 · Wie die Rechnung berechnet wird
Jede Anfrage misst fünf Token-Kategorien — dasselbe Modell wie bei den Anbietern, daher entsprechen unsere Token-Preise 1:1 dem Erwarteten:
| Kategorie | Bedeutung | Relativer Preis |
|---|---|---|
| Eingabe-Token | Ihr Prompt, System-Prompt, Tool-Definitionen | 1× |
| Ausgabe-Token | Die generierte Antwort | meist 5× Eingabe |
| Cache-Schreiben | Erstes Caching eines Prompt-Präfixes | 1,25× Eingabe |
| Cache-Lesen | Wiederverwendung eines gecachten Präfixes (wiederholte Prompts) | 0,1× Eingabe — größter Hebel |
| Thinking-Token | Verborgenes Reasoning (Opus/Sonnet/Thinking-Modelle) | zum Ausgabepreis |
Praxistipps: System-Prompt stabil halten, um Cache-Lesevorgänge zu maximieren (10× günstiger als frische Eingabe); Streaming kostet wie ohne Streaming; und der Nutzungsverlauf im Dashboard schlüsselt jede Anfrage bis zum Token auf.
4 · Warum überhaupt über ein Gateway?
5 · Glossar
| Begriff | Einfache Bedeutung |
|---|---|
| API-Schlüssel | Ihr geheimes Zugangsmerkmal; senden Sie es als Authorization: Bearer sk-tp-… |
| Base-URL | Die Gateway-Adresse, die Sie in ein Tool einfügen, z. B. https://thunder-peak.com/v1 |
| Kontextfenster | Maximale Token pro Anfrage (z. B. 1 Mio. ≈ eine ganze Codebasis) |
| SSE / Streaming | Ausgabe Token für Token; lässt Chat- und Agent-UIs sofort wirken |
| Tool-Aufruf | Das Modell bittet Ihre App, Funktionen auszuführen — die Grundlage von Agenten |
| Reasoning / Thinking | Modelle, die vor der Antwort „denken“; stärker, aber teurer pro Token |
| Ratenlimit | Anfragen pro Minute je Schlüssel — in ThunderPeak pro Schlüssel konfigurierbar |