2026 年 AI API 市场,定价比模型更复杂
2026 年上半年,主流 AI 模型家族已扩展到 6 大阵营:OpenAI、Anthropic、Google、DeepSeek、Meta、Mistral。每家都推出了旗舰版、轻量版、推理版等多个档位,输入/输出价格相差最高达 100 倍。同一个任务,选 GPT-4o-mini 可能只需 0.01 美元,换成 Claude 3.5 Sonnet 却要 0.90 美元。
本文整理 10 款主流模型的最新 API 定价(2026 年 6 月最新官方报价),并用 5 个真实场景试算实际成本,帮你在预算与效果间找到平衡点。文末附赠选型决策树,直接对号入座。
文中所有价格以美元 / 百万 tokens 为单位,免费额度以官方公开政策为准,实际调用请以开发者控制台为准。
定价总览表:10 款主流模型一览无遗
下表涵盖 6 大模型家族的旗舰与轻量版本,按输入价格从低到高排序。Context Window 以官方标称值为准,免费额度指官方控制台或聚合平台提供的每日/每月免费配额。
| 模型 | 输入 $/1M | 输出 $/1M | Context Window | 免费额度 |
|---|---|---|---|---|
| GPT-4o-mini | 0.15 | 0.60 | 128K | OpenAI 免费额度 $5/月 |
| Gemini 2.5 Flash | 0.30 | 2.50 | 1M | Google AI Studio 每日 1,500 次请求免费 |
| DeepSeek V3 | 0.27 | 1.10 | 128K | OpenRouter 每日 50 次免费 |
| DeepSeek R1 | 0.55 | 2.19 | 128K | OpenRouter 每日 50 次免费 |
| Llama 4 (70B) | 0.60 | 0.80 | 128K | Meta 官方 / 合作商免费额度不一 |
| Mistral Large | 2.00 | 6.00 | 128K | Mistral 平台每月 $1 免费额度 |
| GPT-4o | 2.50 | 10.00 | 128K | OpenAI 免费额度 $5/月 |
| Claude 3 Haiku | 0.25 | 1.25 | 200K | Anthropic Console 每月 $5 免费额度 |
| Gemini 2.5 Pro | 1.25 | 10.00 | 2M | Google AI Studio 每日 1,500 次请求免费 |
| Claude 3.5 Sonnet | 3.00 | 15.00 | 200K | Anthropic Console 每月 $5 免费额度 |
注:DeepSeek、Llama 4、Mistral 价格以 OpenRouter 等聚合平台公开报价为准,官方直连价格可能不同。免费额度政策常变动,请以各平台最新公告为准。
以上定价即时更新 → Token 费用预估器
5 个常见场景费用试算:同一任务,价差高达 50 倍
为了让价格更有体感,我们设计 5 个实际业务场景,分别计算 10 款模型的单次调用成本。Token 数按中文场景估算:1 个中文字 ≈ 1.5 tokens,英文单词 ≈ 1.3 tokens。
场景 A:写 500 字中文文章(Prompt 50 字 + Output 500 字)
输入 ≈ 75 tokens,输出 ≈ 750 tokens
- 最便宜:GPT-4o-mini ≈ $0.0005
- 最贵:Claude 3.5 Sonnet ≈ $0.0115
- CP 值最高:Gemini 2.5 Flash ≈ $0.0021(价格低、1M Context、免费额度大)
结论:纯文字生成任务,轻量模型完全足够,旗舰版溢价 20 倍以上。
场景 B:程式码审查(Prompt 2000 字 + Output 500 字)
输入 ≈ 3,000 tokens,输出 ≈ 750 tokens
- 最便宜:GPT-4o-mini ≈ $0.0014
- 最贵:Claude 3.5 Sonnet ≈ $0.0203
- CP 值最高:DeepSeek V3 ≈ $0.0016(程式码能力强、价格低、128K Context 足够)
结论:代码任务首选 DeepSeek V3 或 GPT-4o-mini,Claude 仅在需要极强推理时考虑。
场景 C:翻译 1000 字中文 → 英文
输入 ≈ 1,500 tokens,输出 ≈ 1,300 tokens
- 最便宜:GPT-4o-mini ≈ $0.0011
- 最贵:Claude 3.5 Sonnet ≈ $0.0240
- CP 值最高:Gemini 2.5 Flash ≈ $0.0037(翻译质量稳定、免费额度覆盖日常用量)
结论:翻译属于确定性任务,小模型表现接近大模型,无需付旗舰溢价。
场景 D:长文件摘要(Input 10K tokens + Output 500 字)
输入 ≈ 10,000 tokens,输出 ≈ 750 tokens
- 最便宜:Gemini 2.5 Flash ≈ $0.0049(1M Context 免费吃下)
- 最贵:Claude 3.5 Sonnet ≈ $0.0413
- CP 值最高:Gemini 2.5 Pro ≈ $0.0200(2M Context、推理更强、适合超长文档)
结论:长文本场景 Context Window 成关键门槛,Gemini 2.5 系列以超大窗口 + 低价形成独特优势。
场景 E:闲聊 20 轮对话(Input 500 + Output 500 × 20 轮)
累计输入 ≈ 10,000 tokens,累计输出 ≈ 10,000 tokens
- 最便宜:GPT-4o-mini ≈ $0.0075
- 最贵:Claude 3.5 Sonnet ≈ $0.1800
- CP 值最高:GPT-4o-mini 或 DeepSeek V3 ≈ $0.0137(多轮对话 token 累积快,轻量模型优势明显)
结论:长对话场景输出 token 占比高,Output 价格低的模型优势被放大。
场景选型速查表
| 场景 | 首选模型 | 备选模型 | 避坑指南 |
|---|---|---|---|
| 写文章/文案 | GPT-4o-mini | Gemini 2.5 Flash | 别用 Claude 3.5 Sonnet 写简单文案 |
| 代码审查/生成 | DeepSeek V3 | GPT-4o-mini | 复杂架构设计才上 Claude 3.5 Sonnet |
| 翻译/格式转换 | Gemini 2.5 Flash | GPT-4o-mini | 确定性任务不需要旗舰推理 |
| 长文档摘要/分析 | Gemini 2.5 Pro | Gemini 2.5 Flash | 超 128K 文档只能选 Gemini 2.5 系列 |
| 多轮聊天机器人 | GPT-4o-mini | DeepSeek V3 | 控制对话历史长度,避免 token 爆炸 |
免费额度 vs 付费 API:什么时候该掏钱?
三大聚合平台的免费策略差异很大,直接影响中小开发者的选型:
OpenRouter
- 每日 50 次免费请求(含 DeepSeek V3/R1、Llama 4、Mistral 等)
- 适合:原型验证、个人项目、每日调用 < 50 次的轻量应用
- 限制:速率限制严格、无 SLA、部分模型需排队
Google AI Studio
- Gemini 2.5 Flash/Pro 每日 1,500 次请求免费
- 适合:高频调用、长文本处理、需要 1M+ Context 的场景
- 优势:免费额度最大、Context Window 最长、支援 Grounding 搜索
Anthropic Console / OpenAI Platform
- 每月 $5 免费额度(约 100-200 万 tokens,视模型而定)
- 适合:需要官方 SLA、合规要求高、企业级应用
- 缺点:免费额度用完即停,无每日重置机制
决策建议
- 免费额度足够时:日调用 < 1,000 次、单次 Context < 100K、容忍偶发限流 → 直接用 Google AI Studio 或 OpenRouter
- 必须付费时:生产环境需 SLA、日调用 > 5,000 次、需专用端点、合规要求数据不经第三方 → 直连官方 API 或企业版
- 混合策略:开发/测试用免费额度,上线切付费;或用 OpenRouter 做 Fallback,主流量走直连
选模型决策树:3 步找到你的最佳搭档
回答三个问题,直接定型:
- 任务类型是什么?
- 确定性任务(翻译、摘要、格式转换、简单写作)→ 进入第 2 题
- 复杂推理任务(代码架构、数学证明、逻辑推理、创意策划)→ 进入第 3 题
- 超长文本处理(> 100K tokens 输入)→ 直接选 Gemini 2.5 Pro/Flash
- 预算如何?
- 极低(< $0.01/次)→ GPT-4o-mini / Gemini 2.5 Flash / DeepSeek V3
- 中等($0.01-0.05/次)→ GPT-4o / Claude 3 Haiku
- 不敏感(> $0.05/次)→ Claude 3.5 Sonnet / Gemini 2.5 Pro
- 需要什么特殊能力?
- 最强推理、代码生成 → Claude 3.5 Sonnet
- 超长上下文、多模态、搜索增强 → Gemini 2.5 Pro
- 开源可控、私有化部署 → Llama 4 / DeepSeek V3(自建或聚合平台)
- 法语/多语言优势 → Mistral Large
完整模型家族对比表 → 名词百科:模型家族
下一步:算算你的具体成本
每个业务场景的 token 消耗不同,通用表格只能参考。想精确到分?
- 👉 Token 费用预估器 — 输入 Prompt/Output 长度,秒出 10 款模型实时价格
- 👉 名词百科 — 不懂 Context Window、Input/Output Token、Temperature 怎么算?这里全有定义
