下方活数据表列出本站持续评测的模型的官方 API 牌价。大模型 API 按 token 计费,且输入(你发给模型的内容)与输出(模型生成的内容)分开计价——输出单价通常显著高于输入。上下文窗口决定单次请求能塞下多少材料,长上下文模型未必更贵,但把窗口填满的成本会被输入单价放大。
表中数据与本站评测基础设施共用同一份模型注册表:评测跑哪些模型,这里就登记哪些模型的价格,厂商调价后由维护流程同步更新。
几条与具体厂商无关的通用策略:把长而稳定的系统提示词交给厂商的提示缓存机制(缓存命中的输入通常有大幅折扣);按任务难度分流——简单分类、抽取类任务交给小模型,复杂推理再上旗舰;非实时任务走批处理接口通常有额外折扣;控制输出长度比控制输入更省钱,因为输出单价更高。
单看价格会把"便宜但做不对"的模型误判为划算。建议把本表与赢政指数主榜(真实沙箱执行+规则判分)对照:同一档能力里选便宜的,而不是全场选最便宜的。模型详情页也提供逐模型的历史分数曲线。
单位:美元 / 百万 token(官方牌价)。数据来自本站评测所用的模型注册表,价格变动随官方调价更新;“—”表示未登记。
| 模型 | 厂商 | 输入 $/M | 输出 $/M | 上下文 |
|---|---|---|---|---|
| Claude Opus 4.7 | claude | 15 | 75 | 200K |
| Claude Sonnet 4.6 | claude | 3 | 15 | 200K |
| Claude Haiku 4.5 | claude | 0.8 | 4 | 200K |
| DeepSeek V4 Pro | deepseek | 2 | 8 | 128K |
| DeepSeek V4 Flash | deepseek | 0.1 | 0.5 | 128K |
| 豆包 Pro | doubao | 0.8 | 2 | 128K |
| Gemini 3.1 Pro | gemini | 2.5 | 15 | 1000K |
| Gemini 2.5 Pro | gemini | 1.25 | 10 | 1000K |
| Gemini 2.5 Flash | gemini | 0.15 | 0.6 | 1000K |
| GPT-5.5 Pro | gpt | 15 | 60 | 200K |
| GPT-o3 | gpt | 10 | 40 | 200K |
| GPT-5.5 | gpt | 5 | 20 | 200K |
| GPT-5.4 Nano | gpt | 0.1 | 0.4 | 128K |
| Grok 4 | grok | 3 | 15 | 131K |
| Grok 3 mini | grok | 0.3 | 0.5 | 131K |
| Perplexity Sonar | perplexity | 0 | 0 | 128K |
| Qwen3 Max | qwen | 1.6 | 6.4 | 131K |
| GLM-4.6 | zhipu | 2 | 8 | 200K |
表格直接读取本站评测所用的模型注册表(活数据),厂商官宣调价后由维护流程同步;页面本身无需重新发布。
表中为登记时的官方牌价,厂商调价到本站同步之间可能有时间差;分级折扣、缓存折扣、批处理价等也不在牌价内。做预算决策请以厂商官网为最终依据。
月成本 ≈ 请求数 ×(平均输入 token × 输入单价 + 平均输出 token × 输出单价)÷ 1,000,000。先用日志统计平均输入/输出长度,再代入表中单价即可。