在人工智能领域,模型计费方式正引发新的讨论。OpenAI Codex项目负责人Tibo近日通过社交平台揭示了一个关键问题:不同模型对文本的分词方式存在显著差异,导致相同文本的token计数可能相差数倍。这一发现直接冲击了行业普遍采用的"每百万token价格"比较模式。
Tibo用披萨店的价格战作比喻:两家店铺将整张披萨切成不同份数,虽然单片价格更低,但总价可能更高。具体到模型领域,GPT-5.6 Sol分词器将同段文本切分为766个token,而Claude Opus 5则产生1170个token,两者相差34.5%。尽管输入价格均为每百万token5美元,实际费用却因分词效率产生明显差异。
这种差异源于各家模型独特的分词机制。训练数据中高频出现的词汇会被整体识别,如英文中的"the"、"and"等常见词各占一个token;而生僻词或长词则会被拆解,例如"unbelievable"会被分成"un"、"believ"、"able"三个部分。这种统计特性导致技术文档、代码等特殊文本的分词差异更为显著,不同模型对相同代码段的token计数可能相差数倍。
分词标准的不统一甚至影响同一厂商的模型迭代。Anthropic官方文档明确指出,Claude 4.7及后续版本采用新分词器后,相同文本的token数量较早期模型增加约30%。该公司建议用户对每个模型单独计数,避免用旧模型数据估算新模型成本。这种内部差异使得跨厂商价格比较失去基准,如同用不同单位的尺子测量长度。
实际成本构成远比单价复杂。除分词效率外,缓存机制、输出定价和长上下文加价规则共同影响最终账单。GPT-5.6 Sol的缓存输入价仅为标准价的十分之一,适合处理重复前缀的工作负载;但其输出定价高达每百万token30美元,且输入超过272K时整次请求价格翻倍。这意味着看似节省的输入成本,可能被更高的输出费用抵消。
长上下文处理带来的成本递增现象尤为值得关注。Tibo分享的配置指南显示,将Codex上下文窗口扩展至百万token需要调整模型参数,但实际可用容量可能因版本差异大幅缩水。某用户实测报告指出,特定版本下标注1.05M窗口的模型,实际可用容量仅353.4K。这种技术限制意味着长对话场景中,历史记录的重复处理会显著推高成本,分词差异带来的小数点级影响可能演变为整数位差异。
行业专家建议转变评估维度,从关注"每百万token价格"转向计算"完成单个任务的总成本"。这需要综合考虑真实token计数、缓存命中率、输出长度和推理时长等因素。某技术团队测试发现,分词效率更高的模型若存在推理冗余,最终成本可能反超分词效率较低但输出精炼的竞品。这种动态平衡使得模型选择更需结合具体应用场景。










