AI Token 入门指南 — 什么是 Token?怎么计费? | THINPA

 

文章目录
每次你跟 ChatGPT 说一句话,背后都在烧 token。但 token 到底是什么?为什么同样一句话,不同模型算出来的 token 数差这么多?这篇文章从零开始,用真实数据把 token、计价、context window 全部讲清楚。

Token 是什么?

Token 是 AI 模型处理文字的最小单位。你可以把它理解成“AI 世界的音节”——不是一个字、不是一个字母,而是模型阅读文字的“一口大小”。

当你向 AI 发送一句话,模型不会直接读你的文字,而是先把文字切成 token,再逐个处理。这个切分的过程叫做 tokenization。不同语言、不同模型的 tokenizer 切法都不一样。

以下是常见输入的 token 数对照(约略值,以 GPT 系列为准):

输入约略 Token 数说明
“Hello world”~3英文单词约 0.75 字 = 1 token
“你好世界”~4-6中文每个字约 1-1.5 token
1000 字中文文章~1500-2000中文 token 消耗是英文的 2x 左右
1000 字英文文章~750-800英文更“省 token”
一段程式码 (100 行)~200-400程式码包含缩排、符号,token 密度高

想深入了解 tokenization 的技术细节?请见 名词百科:Token

为什么中文比英文贵?

多数 AI tokenizer 以英文为核心设计。英文单词通常被视为一个 token(如 “apple” → 1 token),但中文字元在 tokenizer 的词表中覆盖率低,一个字可能被拆成 1-2 个 token。举个实例:

“苹果”在 GPT-4o 的 tokenizer 中 → 2 个 token;”apple” → 1 个 token。同样的意义,中文成本是英文的 2 倍。这不是 AI 歧视中文,而是 tokenizer 训练语料本身以英文为主导。

不同模型的 Token 差异

不是所有模型的 tokenizer 都一样。不同模型家族使用不同的 tokenizer,导致同一段文字在不同模型下的 token 数有显著差异。

模型家族Tokenizer中文效率备注
GPT-4o / GPT-4o-minicl100k_base中等OpenAI 主流,中文约 1 字 ≈ 1.5 token
Claude 3.5 Sonnet / Haiku自研 tokenizer偏贵中文特别费 token,约 1 字 ≈ 2 token
Gemini 2.5 Pro / FlashSentencePiece较好中英文较均衡,中文约 1 字 ≈ 1.2 token
DeepSeek V3 / R1自研 tokenizer中等接近 OpenAI,中文约 1 字 ≈ 1.5 token
Llama 4 / MistralBPE-based偏贵中文覆盖率偏低,约 1 字 ≈ 1.8 token

实测:同一段 500 字中文商业邮件——GPT-4o 约 750 tokens,Claude 3.5 Sonnet 约 950 tokens,Gemini 2.5 Flash 约 650 tokens。差距可达 30%+。

更多模型家族说明 → 名词百科:模型家族

Token 怎么计费?

AI API 的计费方式很直接:按 token 数量 × 单价。但有三个关键点容易忽略:

Input vs Output 定价差异

几乎所有模型都会区分 input token(你输入的内容)和 output token(AI 生成的内容),而且 output 通常贵得多。这是因为生成 token 的计算量远大于处理输入。常见倍率:

  • GPT-4o:Input $2.50/1M tokens,Output $10.00/1M tokens(4 倍)
  • Claude 3.5 Sonnet:Input $3.00/1M,Output $15.00/1M(5 倍)
  • DeepSeek V3:Input $0.27/1M,Output $1.10/1M(4 倍)
  • Gemini 2.5 Flash:Input $0.15/1M,Output $0.60/1M(4 倍)

实际费用范例

假设你写了一篇 1000 字的中文部落格文章,请 AI 帮忙润色:

  • Prompt(你的原文 + 指令):~1,800 input tokens
  • Output(润色后):~1,500 output tokens
  • GPT-4o:$0.0045 + $0.015 = $0.0195(约 ¥0.14)
  • Claude 3.5 Sonnet:$0.0054 + $0.0225 = $0.0279(约 ¥0.20)
  • DeepSeek V3:$0.0005 + $0.0017 = $0.0022(约 ¥0.016)<- 便宜 10 倍

细节请见 名词百科:Prompt 定价Completion 定价

计费单位很重要

API 定价的单位是“每百万 token”(per million tokens)。如果只看单价数字($2.50、$15.00),感觉不大。但实际使用时,一个中大型专案每月跑几百万到几千万 token 很常见——那时的费用就是几十到几百美元。

Context Window:为什么长度有限制?

Context window(上下文窗口)是模型一次性能“记住”的 token 总容量。不是只有你的 prompt,而是 system prompt + 对话历史 + 当前输入 + 模型输出 全部加在一起。

主流模型的 context window 对照:

模型Context Window约等于多少中文字
GPT-4o128K6-8 万字
Claude 3.5 Sonnet200K10-12 万字
Gemini 2.5 Pro1M50-60 万字(惊人)
DeepSeek V3128K6-8 万字

超过 context window 会发生什么?API 会直接报错,或模型“忘记”最早的内容。这是为什么长对话或长文件处理需要特别留意。

更多说明 → 名词百科:Context Window

省钱实战技巧

Token 直接等于成本。以下是经过实战验证的省钱策略:

1. 短 prompt > 长 prompt

废话少说。去除“请”、“谢谢”、“能不能帮我”等礼貌用语(模型不需要礼貌),直接下指令。同样的任务,简洁 prompt 比啰嗦 prompt 省 20-40% token。

2. 选对模型

简单任务(分类、翻译、格式转换)用 GPT-4o-miniGemini 2.5 Flash。复杂推理(程式码生成、数学、分析)才用 GPT-4o 或 Claude 3.5 Sonnet。两者的价格差距可达 10-50 倍。

3. 用 System Prompt 固定重复指令

如果你每次都发送相同的指令,把它写进 system prompt。system prompt 只占一次 input token,不会每次重复计算。

4. 控制输出长度

max_tokens 参数限制 output 长度。很多时候 AI 会“多话”——回答完问题还补充一堆。设 limits 直接省钱。

5. 用计算器预估费用

不要凭感觉——在发送大量 API 请求前,先用 Token 费用预估器 输入你的 prompt,看看各种模型的预估费用,选最划算的方案。

常见问题

什么是 AI Token?

Token 是 AI 模型处理文字的最小单位。英文约 0.75 个字等于 1 token,中文约 1 个字等于 1~2 tokens。模型接收文字后会先拆成 token 再处理,所有计费和 context window 都是以 token 为单位。

为什么中文的 Token 比英文多?

因为多数 AI tokenizer 以英文为主设计,中文字元在词表中覆盖率低。同样的语义,中文的 token 数通常是英文的 1.5-2 倍。Claude 的 tokenizer 对中文尤其昂贵。

AI API 怎么计费?

按“每百万 token”计费。Input(你输入的)和 Output(AI 回复的)价格不同,Output 通常贵 2-5 倍。不同模型的单价差别很大,从 $0.15/1M(Gemini 2.5 Flash input)到 $15/1M(Claude 3.5 Sonnet output)都有。

下一步:算算你的 Token 成本

想马上算算你的 prompt 要花多少?用 Token 费用预估器,输入 prompt、选模型,即时看到 token 数与预估费用。

更多 AI 术语解释 → 名词百科

打开 Token 费用预估器 →
查看名词百科 →

滚动至顶部