走进 Tokenizer:为什么同样一段提示词在不同模型上价格不同
来源:dev.to — 2026-08-18
📋 概述
作者打开 tokenizer 这个「黑盒」:token 不是词也不是字符,而是模型视作单个单元的文本块(通常是子词)。解释了为什么同一句话在 Claude 上 3 token、GPT 上 4 token,为什么西班牙语聊天比英语贵,为什么模型算术差,以及如何在发布前准确估算功能成本。核心算法是 Byte-Pair Encoding(BPE)。
🔑 核心要点
- 英语经验法则:1 token 约等于 4 字符、0.75 词,但真实数量完全取决于切分方式。
- 几乎所有主流模型都基于 BPE(或其近亲)做子词切分。
- 理解 token 化能解释同一提示词的跨模型价差、非英语更贵、以及模型算术为何不佳。
- 关键收获:在发布功能前就能精确算出它将烧掉多少 token 预算。
💡 金句
文本进去、一个数字出来、账单到了——那个黑盒值得打开。
👍 0
👎 0
← 返回 dev.to 首页