🔤 Token 是什么?大模型眼中的文字
为什么 AI 收费按「token」算?同一段话,中文还是英文更省?一文看懂,顺便辟个谣。
Token 到底是什么?
🔤 模型的「字母积木」
大模型读不了整篇文章,它把文字切成一小块一小块,每一块就是一个 token。
就像乐高积木——模型用海量 token 拼出整个句子和意思。
✂️ 切分规则(不按字)
切分不是按「字」也不是按「单词」,而是按算法学会的频率。
常见英文单词常是 1 个 token;生僻词会被切成好几个。
I love you = 3 tokens
那么中文和英文,哪个更费 token?答案有点反直觉:看模型。
老模型(如 GPT-4)里,一个中文字常被切成 1~2 个 token,而英文一个常见单词才 1 个——论单字,确实是中文贵。
但同样的意思,中文写出来比英文短一大截(信息密度高)。所以在新一代多语言优化的模型里,中文常常反而比英文更省 token。「中文一定更贵」其实是早期模型的老黄历,不能一概而论。
为什么按 Token 计费?
💰 token = 计算量
模型每处理一个 token 都要做大量计算。token 越多 = 计算量越大 = 成本越高。
所以厂商按 token 收费,本质是按「你用了多少算力」收费。
📦 输入 + 输出都算
提问(输入)和回答(输出)都要收费。
而且输出通常比输入贵!因为生成是一次一个 token 慢慢蹦出来的。
输入便宜 · 输出贵
看到没?同一句话,GPT-4o 里中文 12 < 英文 16(中文更省),而老版 GPT-4 里中文 20 > 英文 16(中文更费)。
所以「中文更贵」不是普适真理。新模型多语言优化做得好,中文反而划算。真正决定账单的,是上下文有多长 + 要输出多少字,而不是语言本身。
| 概念 | 🔤 一个 token | 💰 一个字符 |
|---|---|---|
| 英文 | ≈ 4 个英文字母 | 就是 1 个字母 |
| 中文 | ≈ 1~2 个汉字 | 就是 1 个字 |
| 一句话 | 十几个 token | 几十个字符 |
| 计费 | 按 token 算钱 | 只用于长度统计 |
实操:控制 Token 省钱
精简上下文
别一股脑把整本书塞进去,只给模型「相关片段」,能省一大截 token。
限定输出长度
用 max_tokens 限制回答长度,防止模型长篇大论烧钱。
别让思维链裸奔
生产环境关掉/精简 CoT,只保留必要推理,能显著降本。
先小模型试跑
调 prompt 时先用便宜的小模型验证,成型再上大模型。
Token 是大模型处理文字的「积木」,按 token 计费本质是按算力计费——想省钱,就精简输入、限制输出。
token 是模型处理文字的最小单位,相当于把一句话切成一块块小积木。模型不是按“字”读的,是按 token 读的。粗略地说,一个 token 大概对应 4 个英文字母,或者 1 到 2 个汉字。
因为模型每处理一个 token 都要做计算,token 越多计算量越大、成本越高,所以按 token 收费本质是按算力收费。想省钱的话,主要是精简输入的上下文、限制输出的长度,别让它长篇大论。