文章目录
Token 是什么?
Token 是 AI 模型处理文字的最小单位。你可以把它理解成“AI 世界的音节”——不是一个字、不是一个字母,而是模型阅读文字的“一口大小”。
当你向 AI 发送一句话,模型不会直接读你的文字,而是先把文字切成 token,再逐个处理。这个切分的过程叫做 tokenization。不同语言、不同模型的 tokenizer 切法都不一样。
以下是常见输入的 token 数对照(约略值,以 GPT 系列为准):
| 输入 | 约略 Token 数 | 说明 |
|---|---|---|
| “Hello world” | ~3 | 英文单词约 0.75 字 = 1 token |
| “你好世界” | ~4-6 | 中文每个字约 1-1.5 token |
| 1000 字中文文章 | ~1500-2000 | 中文 token 消耗是英文的 2x 左右 |
| 1000 字英文文章 | ~750-800 | 英文更“省 token” |
| 一段程式码 (100 行) | ~200-400 | 程式码包含缩排、符号,token 密度高 |
想深入了解 tokenization 的技术细节?请见 名词百科:Token。
为什么中文比英文贵?
多数 AI tokenizer 以英文为核心设计。英文单词通常被视为一个 token(如 “apple” → 1 token),但中文字元在 tokenizer 的词表中覆盖率低,一个字可能被拆成 1-2 个 token。举个实例:
“苹果”在 GPT-4o 的 tokenizer 中 → 2 个 token;”apple” → 1 个 token。同样的意义,中文成本是英文的 2 倍。这不是 AI 歧视中文,而是 tokenizer 训练语料本身以英文为主导。
不同模型的 Token 差异
不是所有模型的 tokenizer 都一样。不同模型家族使用不同的 tokenizer,导致同一段文字在不同模型下的 token 数有显著差异。
| 模型家族 | Tokenizer | 中文效率 | 备注 |
|---|---|---|---|
| GPT-4o / GPT-4o-mini | cl100k_base | 中等 | OpenAI 主流,中文约 1 字 ≈ 1.5 token |
| Claude 3.5 Sonnet / Haiku | 自研 tokenizer | 偏贵 | 中文特别费 token,约 1 字 ≈ 2 token |
| Gemini 2.5 Pro / Flash | SentencePiece | 较好 | 中英文较均衡,中文约 1 字 ≈ 1.2 token |
| DeepSeek V3 / R1 | 自研 tokenizer | 中等 | 接近 OpenAI,中文约 1 字 ≈ 1.5 token |
| Llama 4 / Mistral | BPE-based | 偏贵 | 中文覆盖率偏低,约 1 字 ≈ 1.8 token |
实测:同一段 500 字中文商业邮件——GPT-4o 约 750 tokens,Claude 3.5 Sonnet 约 950 tokens,Gemini 2.5 Flash 约 650 tokens。差距可达 30%+。
更多模型家族说明 → 名词百科:模型家族。
Token 怎么计费?
AI API 的计费方式很直接:按 token 数量 × 单价。但有三个关键点容易忽略:
Input vs Output 定价差异
几乎所有模型都会区分 input token(你输入的内容)和 output token(AI 生成的内容),而且 output 通常贵得多。这是因为生成 token 的计算量远大于处理输入。常见倍率:
- GPT-4o:Input $2.50/1M tokens,Output $10.00/1M tokens(4 倍)
- Claude 3.5 Sonnet:Input $3.00/1M,Output $15.00/1M(5 倍)
- DeepSeek V3:Input $0.27/1M,Output $1.10/1M(4 倍)
- Gemini 2.5 Flash:Input $0.15/1M,Output $0.60/1M(4 倍)
实际费用范例
假设你写了一篇 1000 字的中文部落格文章,请 AI 帮忙润色:
- Prompt(你的原文 + 指令):~1,800 input tokens
- Output(润色后):~1,500 output tokens
- GPT-4o:$0.0045 + $0.015 = $0.0195(约 ¥0.14)
- Claude 3.5 Sonnet:$0.0054 + $0.0225 = $0.0279(约 ¥0.20)
- DeepSeek V3:$0.0005 + $0.0017 = $0.0022(约 ¥0.016)<- 便宜 10 倍
细节请见 名词百科:Prompt 定价 和 Completion 定价。
计费单位很重要
API 定价的单位是“每百万 token”(per million tokens)。如果只看单价数字($2.50、$15.00),感觉不大。但实际使用时,一个中大型专案每月跑几百万到几千万 token 很常见——那时的费用就是几十到几百美元。
Context Window:为什么长度有限制?
Context window(上下文窗口)是模型一次性能“记住”的 token 总容量。不是只有你的 prompt,而是 system prompt + 对话历史 + 当前输入 + 模型输出 全部加在一起。
主流模型的 context window 对照:
| 模型 | Context Window | 约等于多少中文字 |
|---|---|---|
| GPT-4o | 128K | 6-8 万字 |
| Claude 3.5 Sonnet | 200K | 10-12 万字 |
| Gemini 2.5 Pro | 1M | 50-60 万字(惊人) |
| DeepSeek V3 | 128K | 6-8 万字 |
超过 context window 会发生什么?API 会直接报错,或模型“忘记”最早的内容。这是为什么长对话或长文件处理需要特别留意。
更多说明 → 名词百科:Context Window。
省钱实战技巧
Token 直接等于成本。以下是经过实战验证的省钱策略:
1. 短 prompt > 长 prompt
废话少说。去除“请”、“谢谢”、“能不能帮我”等礼貌用语(模型不需要礼貌),直接下指令。同样的任务,简洁 prompt 比啰嗦 prompt 省 20-40% token。
2. 选对模型
简单任务(分类、翻译、格式转换)用 GPT-4o-mini 或 Gemini 2.5 Flash。复杂推理(程式码生成、数学、分析)才用 GPT-4o 或 Claude 3.5 Sonnet。两者的价格差距可达 10-50 倍。
3. 用 System Prompt 固定重复指令
如果你每次都发送相同的指令,把它写进 system prompt。system prompt 只占一次 input token,不会每次重复计算。
4. 控制输出长度
用 max_tokens 参数限制 output 长度。很多时候 AI 会“多话”——回答完问题还补充一堆。设 limits 直接省钱。
5. 用计算器预估费用
不要凭感觉——在发送大量 API 请求前,先用 Token 费用预估器 输入你的 prompt,看看各种模型的预估费用,选最划算的方案。
常见问题
什么是 AI Token?
Token 是 AI 模型处理文字的最小单位。英文约 0.75 个字等于 1 token,中文约 1 个字等于 1~2 tokens。模型接收文字后会先拆成 token 再处理,所有计费和 context window 都是以 token 为单位。
为什么中文的 Token 比英文多?
因为多数 AI tokenizer 以英文为主设计,中文字元在词表中覆盖率低。同样的语义,中文的 token 数通常是英文的 1.5-2 倍。Claude 的 tokenizer 对中文尤其昂贵。
AI API 怎么计费?
按“每百万 token”计费。Input(你输入的)和 Output(AI 回复的)价格不同,Output 通常贵 2-5 倍。不同模型的单价差别很大,从 $0.15/1M(Gemini 2.5 Flash input)到 $15/1M(Claude 3.5 Sonnet output)都有。
下一步:算算你的 Token 成本
想马上算算你的 prompt 要花多少?用 Token 费用预估器,输入 prompt、选模型,即时看到 token 数与预估费用。
更多 AI 术语解释 → 名词百科
