🤖 大模型基础 🟢 入门 ⏱ 5 分钟

🔤 Token 是什么?大模型眼中的文字

为什么 AI 收费按「token」算?同一段话,中文还是英文更省?一文看懂,顺便辟个谣。

1

Token 到底是什么?

🔤 模型的「字母积木」

大模型读不了整篇文章,它把文字切成一小块一小块,每一块就是一个 token。

就像乐高积木——模型用海量 token 拼出整个句子和意思。

✂️ 切分规则(不按字)

切分不是按「字」也不是按「单词」,而是按算法学会的频率

常见英文单词常是 1 个 token;生僻词会被切成好几个。

I love you = 3 tokens

🟡 一个 token 的样子
I love AI ❤️ —— 大模型眼里的切法
I "I" = 1 token(常见单词)
love "love" = 1 token
AI "AI" = 1 token
🔴 生僻词的悲剧
"supercalifragilistic"(超级长词)
1 "super" = 1 token
2 "cali" = 1 token
3 "fragilistic" = 3 token
总共被切成 6 个 token

那么中文和英文,哪个更费 token?答案有点反直觉:看模型。

老模型(如 GPT-4)里,一个中文字常被切成 1~2 个 token,而英文一个常见单词才 1 个——论单字,确实是中文贵

同样的意思,中文写出来比英文短一大截(信息密度高)。所以在新一代多语言优化的模型里,中文常常反而比英文更省 token。「中文一定更贵」其实是早期模型的老黄历,不能一概而论。

2

为什么按 Token 计费?

💰 token = 计算量

模型每处理一个 token 都要做大量计算。token 越多 = 计算量越大 = 成本越高

所以厂商按 token 收费,本质是按「你用了多少算力」收费。

📦 输入 + 输出都算

提问(输入)和回答(输出)都要收费。

而且输出通常比输入贵!因为生成是一次一个 token 慢慢蹦出来的。

输入便宜 · 输出贵

🇨🇳 中文(17 字)
今天北京的天气怎么样?适合出门吗?
4o GPT-4o (o200k):12 token
4 GPT-4 (cl100k):20 token
🇬🇧 英文(68 字符)
What is the weather like in Beijing today?
4o GPT-4o (o200k):16 token
4 GPT-4 (cl100k):16 token

看到没?同一句话,GPT-4o 里中文 12 < 英文 16(中文更省),而老版 GPT-4 里中文 20 > 英文 16(中文更费)。

所以「中文更贵」不是普适真理。新模型多语言优化做得好,中文反而划算。真正决定账单的,是上下文有多长 + 要输出多少字,而不是语言本身。

概念🔤 一个 token💰 一个字符
英文≈ 4 个英文字母就是 1 个字母
中文≈ 1~2 个汉字就是 1 个字
一句话十几个 token几十个字符
计费按 token 算钱只用于长度统计
3

实操:控制 Token 省钱

✂️
精简上下文

别一股脑把整本书塞进去,只给模型「相关片段」,能省一大截 token。

🎯
限定输出长度

用 max_tokens 限制回答长度,防止模型长篇大论烧钱。

🧠
别让思维链裸奔

生产环境关掉/精简 CoT,只保留必要推理,能显著降本。

🪜
先小模型试跑

调 prompt 时先用便宜的小模型验证,成型再上大模型。

一句话总结

Token 是大模型处理文字的「积木」,按 token 计费本质是按算力计费——想省钱,就精简输入、限制输出。

🎤 面试问答 · 口语化回答
面试官如果问到你,可以这样口语化地回答:
面试官什么是 token?

token 是模型处理文字的最小单位,相当于把一句话切成一块块小积木。模型不是按“字”读的,是按 token 读的。粗略地说,一个 token 大概对应 4 个英文字母,或者 1 到 2 个汉字。

💡 加分点:可以举个具体例子更容易懂,比如 “I love AI” 大约就是 3 个 token。
面试官为什么 API 按 token 收费?

因为模型每处理一个 token 都要做计算,token 越多计算量越大、成本越高,所以按 token 收费本质是按算力收费。想省钱的话,主要是精简输入的上下文、限制输出的长度,别让它长篇大论。

💡 加分点:面试官如果追问中文英文哪个贵:可以说看模型,新模型多语言优化做得好,同样的意思中文信息密度高、反而常常更省,别被“中文一定贵”的旧说法带偏。
00:00