① 怎么选模型
| 任务 | 推荐 | 理由 |
|---|---|---|
| 最难推理(科研/数学/架构) | Claude Opus 5 / GLM-5.3 | 思维链最深,Opus 5 带 1M 上下文 |
| 日常编码(IDE Agent/评审) | Claude Sonnet 5 / DeepSeek V4 | 速度与质量最佳平衡 |
| 海量任务(分类/抽取/批处理) | Haiku 4.5 / DS V4 Flash / Qwen Flash | 成本低数倍,指令跟随依然强 |
| 中文工作流(内容/长文档/本地化) | Qwen 3.8 / Kimi K3 / GLM | 中文理解最强 |
| 视觉/多模态 | Qwen 3-VL Plus | 图像理解,价格远低于旗舰视觉 |
| Codex/GPT 生态 | GPT-5.5 / 5.4 | OpenAI Agent 框架原生适配 |
心法:正式工作从中间档(Sonnet 5 / DS V4)起步,任务确实难再升 Opus 级,重复性任务降 Haiku/Flash 档——账单可省约 10 倍,质量损失常为零。
② 三种协议
| 协议 | 端点 | 适用 |
|---|---|---|
| OpenAI Chat | /v1/chat/completions | OpenAI SDK、Cherry Studio、多数工具 |
| Anthropic Messages | /v1/messages | Claude Code、Anthropic SDK、Cursor |
| Responses | /v1/responses | Codex CLI/扩展、新版 OpenAI SDK |
③ 账单怎么算
每次请求计量五类 token:输入(1×)、输出(约 5×输入)、缓存写入(1.25×输入)、缓存读取(0.1×输入——最大的省钱杠杆)、思考 token(按输出计)。技巧:保持 system prompt 稳定以最大化缓存命中;流式与非流式同价;控制台用量明细精确到 token。
④ 为什么走网关而不是直连?
⚡ 一把 Key 全模型
不用为每家厂商单独注册、单独充值、单独看面板。Claude、GPT、DeepSeek、Qwen、Kimi、GLM 共享一个余额。
💳 无需海外信用卡
USDT 在 TRC-20 / BSC / Solana 三条链充值,$10 起充或 $10,000 一视同仁。
🎯 长期固定折扣
Claude/GPT 官方价 6.6 折,中国 7–8.8 折——折扣是政策,不是会过期的促销。
🛡 每 Key 独立控制
每个项目一把 Key、独立限额,控制台一键冻结或删除。
⑤ 省钱心法
- 保持 system prompt 稳定——缓存读取只有新输入的 1/10 价格,这是最大的省钱杠杆。
- 从中间档起步——Sonnet 5 / DeepSeek V4 能扛住大多数正式工作,账单比旗舰低约 10 倍。
- 重复性任务降档——分类、抽取、批量处理用 Haiku / Flash 档,质量损失常常为零。
- 看用量明细——控制台每次调用都有 token 级记录,钱花在哪一目了然。
⑥ 术语速查
| 术语 | 通俗含义 |
|---|---|
| API Key | 你的密钥凭据,请求头 Authorization: Bearer sk-tp-… |
| Base URL | 填入工具的网关地址,如 https://thunder-peak.com/v1 |
| 上下文窗口 | 模型单次请求可见的最大 token(1M ≈ 整个代码库) |
| SSE / 流式 | 逐 token 输出,让对话与 Agent 界面"即时" |
| 工具调用 | 模型请求你的程序执行函数——Agent 的基础 |
| 思考/推理 | 先想后答的模型;更强但每 token 更贵 |