AI 名词百科
从 Token 到 Context Window,从 Prompt 到 API Key — 15 个 AI 核心术语,用最浅显的语言解释清楚。
适合开发者、创作者、以及任何想理解 AI 的人。
Token 相关
AI 模型处理文字的最小单位。英文约 0.75 字 = 1 token,中文约 1 字 ≈ 1~2 tokens。
Token 是什么?Token 是 AI 模型理解和生成文本的基本单元。你可以把它想像成“单词碎片”——一个完整的英文单词可能被拆成多个 token(如 "unbelievable" → "un"、"believe"、"able"),而中文的每个字约等于 1~2 个 token。不同模型家族使用不同的 tokenizer 来决定如何切分文字,这导致同一段文字在不同模型上的 token 数可能不同。
理解 Token 的概念非常重要,因为 AI 服务的计费完全基于 Token 数量。你每次调用 API 时,付的不是按字数、不是按字节,而是按 token 数。这也是为什么 Token 费用预估器是使用 AI API 的必备工具。
例子: "Hello, how are you?" 约 5 个 token;“你好吗?”约 4~6 个 token。一篇 1000 字的中文文章约 1500~2000 tokens。OpenAI 的 cl100k_base tokenizer 将 1 个英文单词平均切为 0.75 个 token。Token 数量还直接影响模型的“记忆力”——也就是 context window 大小。一个模型能处理的 token 总量决定了它能“看到”多少上下文,这在长文分析、对话记录等场景中至关重要。
将文字切分成 token 的程式。GPT 系列用 BPE,Gemini/Llama 用 SentencePiece。
Tokenizer 的工作方式。Tokenizer 是 AI 模型管线中的第一步,它将原始文字(你输入的 prompt)转换为模型可以理解的数字序列(token ID)。这些数字序列就是模型进行推理的输入。没有 tokenizer,模型就无法理解文字——它是人类语言和机器学习模型之间的“翻译官”。
不同模型家族使用不同的 tokenizer 技术,这直接影响到:(1)同一段文字在不同模型上的 token 数不同,从而影响计费;(2)模型对不同语言的处理能力差异很大。例如,一个对中文优化较好的 tokenizer 能将中文文本压缩得更小。这也是为什么你的 prompt 在 GPT-5 和 Gemini 2.5 上的 token 数不一样。
例子: 同一句话“今天天气很好”,GPT 的 BPE tokenizer 可能切为 5 个 token,而 Gemini 的 SentencePiece 可能切为 8 个 token。差异源于各自的训练数据和算法不同。THINPA 的 Token 费用计算器已将此差异纳入估算。压缩算法,GPT 系列的 tokenizer 基础。反复合并出现最频繁的相邻字元对。
BPE 的原理。BPE(Byte Pair Encoding)最初是 1994 年提出的资料压缩算法,后来被 OpenAI 采用作为 tokenizer 的核心技术。它的运作方式非常直观:反复扫描文本,找出出现频率最高的相邻字元对(byte pair),然后将这个对合并为一个新的符号。经过多次迭代后,BPE 就能建立一个覆盖常见单词和子词的词汇表。
BPE 的优势在于:(1)能处理未见过的单词——将新单词分解为已知的子词 token;(2)词汇表大小可控——你可以设定目标词汇表大小(例如 50,000 个 token);(3)语言无关——不需要预先知道语言规则。这也是为什么 GPT 系列能很好地处理多语言输入。
例子: 假设文本中 "th" 出现频率最高(1000 次),BPE 会先将 "th" 合并为一个 token。接着 "the" 出现 800 次,再合并。最终得到 "the"、"is"、"are" 等常见单词作为单一 token,大幅提高编码效率。OpenAI 的 GPT-5 仍在使用 BPE 的改良版本。Google 开源的 tokenizer,用于 Gemini、Llama、Mistral。支援多语言子词切割。
SentencePiece 与 BPE 的关键差异。SentencePiece 是 Google 在 2018 年开源的 tokenizer 函式库,与 BPE 最大的不同在于:它能直接处理未经预处理的原始文字(raw text),不需要预先进行语言特定的分词(如英文的空格分词、中文的分词)。这使得 SentencePiece 成为真正的“语言无关”tokenizer。
SentencePiece 的另一个关键特性是支援两种训练算法:Unigram Language Model 和 BPE。也就是说,SentencePiece 是一个框架,它可以使用 BPE 算法,也可以使用 Unigram 算法。Llama 3 使用的是 SentencePiece + BPE 的组合,而 Gemini 使用的是 SentencePiece + Unigram。这使得 SentencePiece 成为目前开源社群最广泛使用的 tokenizer 实现。
例子: 一段包含“Hello 你好 こんにちは”的混合文字,SentencePiece 不需要任何语言检测就能直接切割。Llama 3 的词汇表大小为 128K tokens,其中包含了大量中、日、韩、阿拉伯等多语言字符的专用 token。AI 模型一次能处理的最大 token 总量。GPT-4o 128K、Claude 3.5 200K、Gemini 2.5 Pro 1M。
Context Window 决定 AI 的“记忆力”。Context Window(上下文长度/上下文窗口)决定了 AI 模型在生成回复时能“看到”的最大文本量,包括你输入的内容(input)和 AI 生成的回复(output)的总和。举例来说,如果一个模型的 context window 是 128K tokens,而你输入了 100K tokens 的内容,那么 AI 最多只能生成 28K tokens 的回复。超过 context window 的内容将被模型“遗忘”。
近年来 context window 的增长非常迅速:2023 年主流的 4K/8K 在 2026 年已经被 128K/200K/1M 取代。更大的 context window 意味着:(1)可以一次处理完整书籍或文件;(2)对话机器人可以记住更长的历史;(3)代码分析工具可以处理更大的代码库。但需要注意的是,input tokens 越多,费用也越高。
例子: GPT-4o 128K ≈ 9.6 万个英文字、约 8 万个中文字。Gemini 2.5 Pro 1M ≈ 75 万个中文字,足以一次处理整套《三体》三部曲。Claude 3.5 Sonnet 200K 可一次分析 500 页的 PDF 文件。但输入 1M tokens 到 Gemini 2.5 Pro 的费用约为 $1.25(prompt 定价计算)。在 Token 费用计算器中,你可以选择不同模型的 context window,查看输入量与费用的关系。
模型相关
使用者输入给 AI 的指令或问题。计费时算 input。
Prompt 是你的“说话内容”。Prompt(提示词/提示)是你与 AI 互动的起点——它可以是问题(“太阳系有几颗行星?”)、指令(“用 Python 写一个贪食蛇游戏”)、或是上下文(“以下是一段客户邮件,请帮我回复”)。在 API 计费中,prompt 被计为 input tokens,费用通常较低。
写出好的 prompt 是一项重要技能,称为 Prompt Engineering(提示工程)。好的 prompt 通常包含:明确的角色设定、具体的任务描述、期望的输出格式、以及必要的上下文或范例。一个精心设计的 prompt 可以让模型输出品质提升数倍,同时节省 token 消耗(因为减少了后续反复修改的成本)。
例子: 差的 prompt:“写个文章。”好的 prompt:“你是一位专业的 SEO 顾问。请分析以下关于‘AI Token 计费’的文章(见下方),指出关键词密度问题,并给出 3 条具体的优化建议。每条建议控制在 50 字以内。”好的 prompt 约消耗 20~30 个 input tokens,差的 prompt 虽然 token 更少,但往往需要多次迭代才能得到满意的结果。AI 根据 prompt 生成的回复。计费时算 output,通常比 input 贵 2~5x。
Completion 是 AI 的“回答”。Completion(也称为 generation / response)是 AI 模型根据你的 prompt 所生成的文本回应。在技术层面,模型通过反复预测“下一个最可能的 token”来逐个生成 completion,直到达到设定的长度上限或遇到停止符号。
由于生成过程比理解 prompt 需要更多的计算资源(逐个 token 的推导无法并行化),completion 的定价通常比 prompt 贵 2~5 倍。举例来说,GPT-5 的 completion 定价为 $10/1M tokens,而 prompt 定价仅 $1.25/1M——相差 8 倍。这意味着如果你的应用需要大量生成(如聊天机器人、内容批量创作),completion 费用会占总成本的大部分。
例子: 你问“帮我写一封请假邮件”,模型生成了一封 200 字的邮件,这封邮件就是 completion。假设 prompt 50 tokens(费用 $0.0000625),completion 300 tokens(按 8 倍 rate 计算 $0.003),completion 费用是 prompt 的 48 倍。在 Token 费用计算器中,你可以拖动输出长度滑块,即时看到 completion 费用的变化。使用相同 tokenizer 和架构的一组模型。如 GPT-4o 和 GPT-4o-mini 同属 OpenAI 家族。
为什么模型家族重要?同一模型家族内的模型共享核心技术架构和 tokenizer,这意味着同一段文字在不同家族成员中的 token 数是相同的。例如,GPT-4o 和 GPT-4o-mini 使用相同的 cl100k_base tokenizer,因此你的 prompt 在两者上的 token 数完全一致。但参数量和优化目标不同,所以在性能、速度和价格上有所差异。
了解模型家族有助于:(1)预估 Token 数——同一家族内 token 数相同,只需估算一次;(2)选择合适模型——如果需要低成本方案,在同一家族内选择 mini/lite 版本即可,不会影响 token 计数;(3)理解计费差异——同一家族内不同型号的单价不同,但 token 数一样。
例子: OpenAI 家族(cl100k_base tokenizer):GPT-4o、GPT-4o-mini、GPT-4.1、GPT-4.1-mini。Google 家族(SentencePiece):Gemini 2.5 Pro、Gemini 2.5 Flash、Gemini 2.5 Flash Lite。Meta 家族(SentencePiece):Llama 4 Maverick、Llama 4 Scout。DeepSeek 家族:V4 Pro、V4 Flash、V3。模型“大脑”中的可调节权重数量。7B = 70 亿参数。
参数量决定模型的“脑容量”。参数(Parameters)是神经网络中可调节的权重和偏置项,决定了模型的知识容量和推理能力。参数越多,模型通常能记住更多知识、理解更复杂的模式,但训练和运行的成本也更高。参数量的标示方式通常用 B(Billion,十亿)为单位,如 7B = 70 亿参数。
需要注意的是:参数量大不等于一定更好。架构设计(如 MoE 混合专家架构)、训练数据品质、训练方法等因素同样重要。例如,DeepSeek V3 有 671B 总参数,但每次推理只激活 37B(MoE 架构),因此运行成本远低于同等参数量的密集模型(dense model)。
例子: 参数量对比:Llama 3 8B(80 亿参数,可跑在消费级显卡)→ GPT-4o 推测约 1.8T(1.8 兆参数,仅云端运行)→ DeepSeek V3 671B(其中 37B 活跃参数,MoE 架构)→ Gemini 2.5 Pro(Google 未公开参数量)。参数量越大的模型,API 定价通常也越高。定价相关
处理使用者输入的每百万 token 费用,通常较低。
Input 定价:便宜的那一半。Prompt Pricing(也称为 input pricing)是指 AI API 对处理使用者输入(即 prompt)所收取的费用,以每百万 token(per 1M tokens)为单位计价。由于分析理解输入的计算成本相对较低(只需要一次前向传播),这部分费用通常也较低。
在选择模型时,场景不同,对 prompt 定价的敏感度也不同:(1)长文分析——如果你的应用需要大量输入(如合约审查、论文分析),应该优先选择 prompt 定价低的模型;(2)对话机器人——如果每次对话都需要带入大量历史记录,input 费用会快速积累。THINPA 的 Token 费用计算器可以帮助你即时比较不同模型的 prompt 定价。
例子: GPT-4o prompt $2.50/1M input tokens。上传一篇 10 万字小说(约 150K tokens)→ input 费用约 $0.375。Claude Opus 4 prompt $15.00/1M →同样 150K tokens 费用约 $2.25,贵了 6 倍。但 Opus 4 的生成品质可能更高。这就是在成本与品质之间的权衡。生成回复的每百万 token 费用,通常比 input 贵 2~5 倍。
Output 定价:贵的那一半。Completion Pricing(也称为 output pricing)是 AI 对生成回复所收取的费用,同样以每百万 token(per 1M tokens)计价。生成过程比理解过程耗费更多 GPU 算力——因为模型需要逐个 token 地预测和生成(自回归生成),无法像处理 input 那样平行计算。这导致 completion 定价通常显著高于 prompt 定价。
Completion 与 prompt 的价格倍数因模型而异:GPT-5 约 8 倍($1.25 vs $10.00),Claude Sonnet 4.5 约 5 倍($3.00 vs $15.00),DeepSeek V4 Flash 约 2 倍($0.09 vs $0.18)。如果你的应用需要大量生成内容(如批量文章写作、程式码生成),建议选择 completion 定价倍数较低的模型来控制成本。
例子: 如果你想使用 AI 每天生成 100 篇产品描述,每篇 output 约 500 tokens(共 50K output tokens)。GPT-5 的 completion 费用为 50K/1M × $10.00 = $0.50/天。如果用 DeepSeek V4 Flash($0.18/1M),仅需 $0.009/天。在 Token 费用计算器中,可以即时对比不同模型在相同 output 长度下的费用差异。AI API 标准计价单位。如 $3/1M input tokens。
为什么用每百万 Token 计价?Per-Million-Token(每百万 token)是当前 AI API 行业的标准计价单位。所有主流模型供应商(OpenAI、Anthropic、Google、DeepSeek 等)都采用这个单位,方便用户进行跨模型比较。之所以不用“每次调用”计费,是因为每次调用的 token 数差异巨大——从几个 token 的简短问答到上百万 token 的长文分析。
计算方式非常简单:总费用 = (input tokens / 1,000,000 × prompt 单价) + (output tokens / 1,000,000 × completion 单价)。例如,$3/1M input tokens 的意思就是:每输入 100 万个 token,收费 3 美元。如果你只输入了 10 万个 token,费用就是 $0.30。
例子: 使用 GPT-4.1(prompt $2.00/1M,completion $8.00/1M)处理 50K input tokens 并生成 10K output tokens:input 费用 = 50K/1M × $2.00 = $0.10 → output 费用 = 10K/1M × $8.00 = $0.08 → 总费用 = $0.18。不到 20 美分。用 Token 费用计算器一键计算。API / 平台相关
第三方 AI API 聚合平台,统一提供 300+ 模型的即时定价与 API 接入。
OpenRouter 是什么?OpenRouter 是一个 AI API 聚合平台,让你通过一个统一的 API 端点访问超过 300 个不同的 AI 模型(包括 GPT-5、Claude 4、Gemini 2.5、DeepSeek V4、Llama 4 等)。它实时聚合各模型供应商的官方定价,并提供一致的计费方式。对于开发者来说,最大的价值在于:无需分别注册每个平台的账号和 API Key,也无需关心各家不同的计费逻辑。
OpenRouter 还提供了一些独特功能:(1)跨模型比较——同一个请求可以同时发送给多个模型,比较结果;(2)即时定价——所有模型的最新定价通过 API 获取,无需手动更新;(3)免费模型——部分模型提供免费 tier,适合测试和学习。THINPA 的 Token 费用计算器就是通过 OpenRouter 的 API 获取最新模型定价数据。
例子: 在同一个页面比较 GPT-5($1.25/$10.00)、Claude Sonnet 4.5($3.00/$15.00)、Gemini 2.5 Pro($1.25/$10.00)的费用差异。无需分别查看 OpenAI、Anthropic、Google 的定价页面——全部通过 OpenRouter 统一获取。THINPA 的 Token 费用计算器每小时同步一次 OpenRouter 定价,确保数据即时准确。存取 AI 服务的认证凭证,不可公开或上传 GitHub。
API Key 就是你的“密码”。API Key(API 金钥)是使用任何 AI API 时的认证凭证,每个 Key 关联到你的账号和计费信息。你可以在各大 AI 平台的管理后台生成和管理 API Key。每次 API 调用都需要在 HTTP Header 中带上你的 Key,服务器通过验证 Key 来识别身份和计费。
安全性是最重要的:切勿将 API Key 公开在 GitHub、前端代码、或任何客户端环境中。一旦泄露,他人可以使用你的 Key 调用 API 产生巨额费用。建议做法:(1)将 API Key 存于环境变数(.env.local),不写入代码;(2)使用 API Key 管理服务(如 1Password);(3)在平台后台设置用量上限(Spending Limit / Budget Alert),一旦接近上限自动告警。
例子: 典型 API Key 格式——OpenAI 以 "sk-" 开头,如 "sk-proj-xxxxxxxx";Anthropic 以 "sk-ant-" 开头;OpenRouter 以 "sk-or-v1-" 开头。如果你的 Key 不小心上传了 GitHub,即使立即删除,也应该立即在后台 revoke(撤销)并生成新的 Key,因为 Key 可能已被爬取。API 每分钟/每天允许的最大请求次数,防止滥用。
Rate Limit 是 API 的“交通规则”。Rate Limit(速率限制)是 API 供应商为了防止滥用和保障服务稳定性而设置的请求限制。限制方式通常包括:RPM(Requests Per Minute,每分钟请求次数)、TPM(Tokens Per Minute,每分钟 token 数)、RPD(Requests Per Day,每天请求总量)。超过限制时 API 会返回 HTTP 429(Too Many Requests)状态码。
在实际开发中,应对 rate limit 的常见策略包括:(1)退避策略(Exponential Backoff)——遇到 429 时,先等 1 秒再重试,如果仍失败则等 2 秒、4 秒、8 秒……;(2)队列化请求——将请求放入队列,控制发送速率;(3)申请提高限制——如果业务确实需要更高的吞吐量,可以联系供应商付费升级 tier。
例子: OpenAI GPT-4o 的典型 rate limit:500 RPM(每分钟 500 次请求)、200K TPM(每分钟 20 万 tokens)。如果你需要大批量处理 10 万条数据,每分钟最多只能发送 500 次请求,预计耗时 200 分钟。如果使用 OpenRouter,rate limit 取决于你的计划 tier——免费用户通常有较低的限制。资料更新日期:2026-06-28。如有变动,请以 Token 费用计算器的即时定价为准。

