AI 模型定价横评(2026 更新)| THINPA

2026 年 AI API 市场,定价比模型更复杂

2026 年上半年,主流 AI 模型家族已扩展到 6 大阵营:OpenAI、Anthropic、Google、DeepSeek、Meta、Mistral。每家都推出了旗舰版、轻量版、推理版等多个档位,输入/输出价格相差最高达 100 倍。同一个任务,选 GPT-4o-mini 可能只需 0.01 美元,换成 Claude 3.5 Sonnet 却要 0.90 美元。

本文整理 10 款主流模型的最新 API 定价(2026 年 6 月最新官方报价),并用 5 个真实场景试算实际成本,帮你在预算与效果间找到平衡点。文末附赠选型决策树,直接对号入座。

文中所有价格以美元 / 百万 tokens 为单位,免费额度以官方公开政策为准,实际调用请以开发者控制台为准。

定价总览表:10 款主流模型一览无遗

下表涵盖 6 大模型家族的旗舰与轻量版本,按输入价格从低到高排序。Context Window 以官方标称值为准,免费额度指官方控制台或聚合平台提供的每日/每月免费配额。

模型输入 $/1M输出 $/1MContext Window免费额度
GPT-4o-mini0.150.60128KOpenAI 免费额度 $5/月
Gemini 2.5 Flash0.302.501MGoogle AI Studio 每日 1,500 次请求免费
DeepSeek V30.271.10128KOpenRouter 每日 50 次免费
DeepSeek R10.552.19128KOpenRouter 每日 50 次免费
Llama 4 (70B)0.600.80128KMeta 官方 / 合作商免费额度不一
Mistral Large2.006.00128KMistral 平台每月 $1 免费额度
GPT-4o2.5010.00128KOpenAI 免费额度 $5/月
Claude 3 Haiku0.251.25200KAnthropic Console 每月 $5 免费额度
Gemini 2.5 Pro1.2510.002MGoogle AI Studio 每日 1,500 次请求免费
Claude 3.5 Sonnet3.0015.00200KAnthropic Console 每月 $5 免费额度

注:DeepSeek、Llama 4、Mistral 价格以 OpenRouter 等聚合平台公开报价为准,官方直连价格可能不同。免费额度政策常变动,请以各平台最新公告为准。

以上定价即时更新 → Token 费用预估器

5 个常见场景费用试算:同一任务,价差高达 50 倍

为了让价格更有体感,我们设计 5 个实际业务场景,分别计算 10 款模型的单次调用成本。Token 数按中文场景估算:1 个中文字 ≈ 1.5 tokens,英文单词 ≈ 1.3 tokens。

场景 A:写 500 字中文文章(Prompt 50 字 + Output 500 字)

输入 ≈ 75 tokens,输出 ≈ 750 tokens

  • 最便宜:GPT-4o-mini ≈ $0.0005
  • 最贵:Claude 3.5 Sonnet ≈ $0.0115
  • CP 值最高:Gemini 2.5 Flash ≈ $0.0021(价格低、1M Context、免费额度大)

结论:纯文字生成任务,轻量模型完全足够,旗舰版溢价 20 倍以上。

场景 B:程式码审查(Prompt 2000 字 + Output 500 字)

输入 ≈ 3,000 tokens,输出 ≈ 750 tokens

  • 最便宜:GPT-4o-mini ≈ $0.0014
  • 最贵:Claude 3.5 Sonnet ≈ $0.0203
  • CP 值最高:DeepSeek V3 ≈ $0.0016(程式码能力强、价格低、128K Context 足够)

结论:代码任务首选 DeepSeek V3 或 GPT-4o-mini,Claude 仅在需要极强推理时考虑。

场景 C:翻译 1000 字中文 → 英文

输入 ≈ 1,500 tokens,输出 ≈ 1,300 tokens

  • 最便宜:GPT-4o-mini ≈ $0.0011
  • 最贵:Claude 3.5 Sonnet ≈ $0.0240
  • CP 值最高:Gemini 2.5 Flash ≈ $0.0037(翻译质量稳定、免费额度覆盖日常用量)

结论:翻译属于确定性任务,小模型表现接近大模型,无需付旗舰溢价。

场景 D:长文件摘要(Input 10K tokens + Output 500 字)

输入 ≈ 10,000 tokens,输出 ≈ 750 tokens

  • 最便宜:Gemini 2.5 Flash ≈ $0.0049(1M Context 免费吃下)
  • 最贵:Claude 3.5 Sonnet ≈ $0.0413
  • CP 值最高:Gemini 2.5 Pro ≈ $0.0200(2M Context、推理更强、适合超长文档)

结论:长文本场景 Context Window 成关键门槛,Gemini 2.5 系列以超大窗口 + 低价形成独特优势。

场景 E:闲聊 20 轮对话(Input 500 + Output 500 × 20 轮)

累计输入 ≈ 10,000 tokens,累计输出 ≈ 10,000 tokens

  • 最便宜:GPT-4o-mini ≈ $0.0075
  • 最贵:Claude 3.5 Sonnet ≈ $0.1800
  • CP 值最高:GPT-4o-mini 或 DeepSeek V3 ≈ $0.0137(多轮对话 token 累积快,轻量模型优势明显)

结论:长对话场景输出 token 占比高,Output 价格低的模型优势被放大。

场景选型速查表

场景首选模型备选模型避坑指南
写文章/文案GPT-4o-miniGemini 2.5 Flash别用 Claude 3.5 Sonnet 写简单文案
代码审查/生成DeepSeek V3GPT-4o-mini复杂架构设计才上 Claude 3.5 Sonnet
翻译/格式转换Gemini 2.5 FlashGPT-4o-mini确定性任务不需要旗舰推理
长文档摘要/分析Gemini 2.5 ProGemini 2.5 Flash超 128K 文档只能选 Gemini 2.5 系列
多轮聊天机器人GPT-4o-miniDeepSeek V3控制对话历史长度,避免 token 爆炸

免费额度 vs 付费 API:什么时候该掏钱?

三大聚合平台的免费策略差异很大,直接影响中小开发者的选型:

OpenRouter

  • 每日 50 次免费请求(含 DeepSeek V3/R1、Llama 4、Mistral 等)
  • 适合:原型验证、个人项目、每日调用 < 50 次的轻量应用
  • 限制:速率限制严格、无 SLA、部分模型需排队

Google AI Studio

  • Gemini 2.5 Flash/Pro 每日 1,500 次请求免费
  • 适合:高频调用、长文本处理、需要 1M+ Context 的场景
  • 优势:免费额度最大、Context Window 最长、支援 Grounding 搜索

Anthropic Console / OpenAI Platform

  • 每月 $5 免费额度(约 100-200 万 tokens,视模型而定)
  • 适合:需要官方 SLA、合规要求高、企业级应用
  • 缺点:免费额度用完即停,无每日重置机制

决策建议

  • 免费额度足够时:日调用 < 1,000 次、单次 Context < 100K、容忍偶发限流 → 直接用 Google AI Studio 或 OpenRouter
  • 必须付费时:生产环境需 SLA、日调用 > 5,000 次、需专用端点、合规要求数据不经第三方 → 直连官方 API 或企业版
  • 混合策略:开发/测试用免费额度,上线切付费;或用 OpenRouter 做 Fallback,主流量走直连

选模型决策树:3 步找到你的最佳搭档

回答三个问题,直接定型:

  1. 任务类型是什么?
    • 确定性任务(翻译、摘要、格式转换、简单写作)→ 进入第 2 题
    • 复杂推理任务(代码架构、数学证明、逻辑推理、创意策划)→ 进入第 3 题
    • 超长文本处理(> 100K tokens 输入)→ 直接选 Gemini 2.5 Pro/Flash
  2. 预算如何?
    • 极低(< $0.01/次)→ GPT-4o-mini / Gemini 2.5 Flash / DeepSeek V3
    • 中等($0.01-0.05/次)→ GPT-4o / Claude 3 Haiku
    • 不敏感(> $0.05/次)→ Claude 3.5 Sonnet / Gemini 2.5 Pro
  3. 需要什么特殊能力?
    • 最强推理、代码生成 → Claude 3.5 Sonnet
    • 超长上下文、多模态、搜索增强 → Gemini 2.5 Pro
    • 开源可控、私有化部署 → Llama 4 / DeepSeek V3(自建或聚合平台)
    • 法语/多语言优势 → Mistral Large

完整模型家族对比表 → 名词百科:模型家族

下一步:算算你的具体成本

每个业务场景的 token 消耗不同,通用表格只能参考。想精确到分?

滚动至顶部