Aioga
AI资讯 / 技巧观点
返回 AI资讯

前沿模型实际成本:tokenizer 差异导致隐性涨价

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-13T21:50:30.963Z热度 77

同一份 TypeScript 文件在 GPT-5.x 上为 681 个 token,在 Claude 最新 tokenizer 下为 1,178 个,相差 1.73 倍。Ant...

技巧观点Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

同一份 TypeScript 文件在 GPT-5.x 上为 681 个 token,在 Claude 最新 tokenizer 下为 1,178 个,相差 1.73 倍。

Anthropic 新 tokenizer 比旧版多产生约 30% 的 token,标价不变,构成隐性涨价。 Claude Opus 4.6 与 Opus 4.8 标价同为 $5.00 / $25.00,但新 tokenizer 使同一代码的 token 数增加约 32%。 Claude Sonnet 5 的 $2.00 / $10.00 为促销价,2026 年 8 月 31 日后恢复 $3.00 / $15.00,届时相同代码成本将比 Sonnet 4.6 高出约 32%。 跨厂商对比中,Claude 新 tokenizer 在代码上比 GPT 多产生 1.50x 至 1.73x 的 token,TypeScript 差距最大。

中文正文 · AI 翻译

我们在每个前沿分词器下统计了相同的字节,使用每个厂商自己的计数端点,并将计数与实际付费请求交叉核对。下面是这些数字以及它们对费率表价格的影响。

Bar chart: the same 2,888-character TypeScript file becomes 681 tokens on GPT-5.x, 718 on Grok 4.5, 788 on Gemini 3 Flash, 898 on Claude's old tokenizer, and 1,178 on Claude's new tokenizer

一个模型的账单是两个数字相乘的结果:

定价页面显示第二个数字,并将第一个数字视为常数。但它不是常数。它取决于模型的分词器,而分词器在不同厂商之间差异很大。两个模型可以列出相同的“$5.00 / 1M 输入令牌”,但针对同一段文字产生显著不同的账单,因为其中一个模型将这段文字分成了更多的令牌。由于没有人公开每内容的令牌数量,我们自己进行了测量。

我们选择了16个实际样例:英文散文、一个HTML页面、JavaScript、Python、TypeScript和Rust文件、JSON工具模式和工具结果、中文聊天和散文、符号密集的文本,以及我们自己的代理系统提示。每个样例都用每个模型的生产分词器按字节计数:

GPT的o200k作为1.00x参考,主要是因为它已经冻结并公开记录超过两年,而Claude的分词器进行了更改。DeepSeek和GLM完全不包含在表中:我们只有粗略的字符除以四的估算值,没有真实的分词器计数,而本文关注的是测量后的数字。

Claude Opus 4.6和Opus 4.8的列表价格都是$5.00 / $25.00。它们之间变化的是分词器。Sonnet 4.6和Opus 4.6使用旧分词器;Sonnet 5、Opus 4.8和Fable 5使用新分词器。下表在Anthropic自己的端点上用两种分词器统计相同的字节:

根据真实代理请求的组成方式对这些行加权,大多数是英文系统提示、工具模式、代码和JSON,新分词器每次请求大约增加32%。中文行几乎没有变化,所以价格上涨主要集中在英文和代码上。

Sonnet 5 的起始价格为 $2.00 / $10.00,低于 Sonnet 4.6 的 $3.00 / $15.00,这看起来像是降价。这是一个引导价格,截止日期为 2026 年 8 月 31 日。在此期间,较低的费率稍微多于覆盖额外的 tokens,因此对于相同的代码,Sonnet 5 比 4.6 稍微便宜一些。从 9 月 1 日起,价格将恢复到 $3.00 / $15.00,额外的 tokens 保持不变,相同的工作在 Sonnet 4.6 的相同标价下将比以前贵大约三分之一。

count_tokens 是一种预测,因此我们还发送了真实的付费请求,使用 max_tokens: 1 并读取 usage.input_tokens,这是发票依据。对于相同的内容,Opus 4.6 计费 2,541 个输入 tokens,Opus 4.8 计费 3,191 个,每个都完全匹配其预测数量。我们对 Fable 5 也进行了相同的检查,这是产品线中最昂贵的模型,它也计费 3,191 个,和 Opus 4.8 完全一致。因此,Fable 使用相同的新分词器,其更高的标价背后没有隐藏额外的每 token 加价。整个验证成本大约为 $0.08。

跨供应商表以 GPT 的 o200k 作为 1.00x 参考。每个单元格是该模型针对相同文件的 token 数除以 GPT 的 token 数,因此 1.20x 意味着比 GPT 多 20% 的 tokens。Claude 的新旧分词器并列显示:

代码行明显高于散文行:TypeScript 为 1.73x,Rust 为 1.58x,JavaScript 为 1.52x,Python 为 1.50x,而英文散文为 1.40x。代码占编码代理处理工作的大部分,因此在该工作负载下,1.50-1.73x 范围是相关的。

为什么 TypeScript 是最坏情况?因为 o200k 在其上效率异常高:每个 token 约 4.24 个字符,这看起来像是训练了大量网页 JavaScript 和 TypeScript 的结果,其中的 camelCase 标识符和 JSX 模式压缩成单个 token。在 Rust 上,它的效率下降到每个 token 约 3.51 个字符。Claude 的分词器在两种语言上的密度大致相等,因此差距恰好在 GPT 最强的地方最大。

中文的表现有所不同。Claude 的表现大约比 GPT 高出 1.45-1.55 倍,无论是使用旧的还是新的分词器(在散文测试中分别为 435 对 433 个标记,而 GPT 为 300 个标记),因此这是 Claude 系列在 CJK 文本上的一个长期特性,而不是新分词器引入的。Gemini 在这里实际上比 GPT 更高效,只有 256 个标记。哪个分词器成本更高,取决于你写的内容。

将标价乘以测得的差异,就可以获得处理相同工作的有效价格。这里的差异是典型英语编码请求的混合乘数,并已归一化为 GPT 的 o200k:

有几行数据值得再看一次。Opus 4.6 和 4.8 具有相同的标价,但有效价格相差约 32%。GPT-5.5 和 GPT-5.6 Sol 使用相同的分词器,因此它们标价相同,实际效果也真的相同。Gemini 3 Flash 的分词器略重于 GPT,但仍然在很大幅度上保持最便宜的选项。

作为一个独立的数据点:Ploy 本周发布了向 GPT-5.6 Sol 的生产迁移:https://ploy.ai/blog/migrating-a-production-ai-agent-to-gpt-5-6 并报告在相同构建下输入标记为 1.70M,而 Claude Opus 4.8 为 2.60M,减少约 35%。这是整个任务的计费,而不是分词器测试,因此还包括模型的冗长性,但方向一致。

上面的一切都测量了一件事:相同字节会变成多少输入标记。完整的代理任务增加了更多变量,而且这些都是重要的变量。模型为达到相同结果会花费多少输出和思考标记?每步上下文加载了多少?调用工具或生成子代理的频率如何?供应商如何定价缓存的读写?

有两个后果值得说明。首先,缓存流量也按 token 收费,因此产生 32% 更多 token 的分词器会使每次缓存写入和每次缓存读取的成本增加约 32%,在长时间的智能代理会话中,缓存读取占据账单的大部分。其次,一旦加入冗长性和思考环节,整个任务的成本可能在任意方向上偏离远超过 1.73 倍。当人们报告某个模型在代理工作中“使用的 token 是另一个模型的 2-4 倍”时,这可能在他们的设置中是真的,即使我们固定场景中的纯输入分词差距从未超过 1.73 倍。这两个数字测量的是不同层面。

按内容类型,我们测量了 Claude 新分词器相较于 GPT 的 o200k 的输入端范围:散文、HTML 和 JSON 为 1.36-1.42 倍;代码为 1.50-1.73 倍(TypeScript 最突出);中文和符号密集文本为 1.44-1.53 倍。我们在标题中提到 TypeScript,是因为它既处于范围的上限,又是编码代理整天处理的内容,而不是因为整个世界都是 1.73 倍。

我们还直接测量了每个任务层,在后续实验中:同样九个模型执行了一个相同的绘图任务,每个模型尝试一次,每次尝试的价格基于提供商的实际使用数据。相同绘图任务的成本根据模型和推理努力程度从 0.004 美元到 0.80 美元不等,最大努力甚至导致三个模型完全未能完成。该实验在这里:The Pelican Benchmark Is Saturated. We Made 9 AI Models Draw a MacBook Pro Instead:/blog/macbook-svg-benchmark。

这些都不能说明某个模型在所有情况下一定正确。GPT-5.x 是处理英文和代码时 token 使用最少的选择,Gemini 3 Flash 在实际效果上显著便宜,而 Claude 模型即使消耗更多 token 运行,也凭借质量赢得市场地位。只要确保你比较的价格是你实际支付的价格,计算了分词器之后。

数据来源:Anthropic 定价(anthropic.com/pricing:https://www.anthropic.com/pricing)、OpenAI 定价(platform.openai.com/docs/pricing:https://platform.openai.com/docs/pricing)、Google Gemini API 定价(ai.google.dev:https://ai.google.dev/gemini-api/docs/pricing)、xAI 定价(docs.x.ai:https://docs.x.ai)。Token 数量来自 Anthropic 的 count_tokens 接口、OpenAI 的 o200k_base(已与实时 API 使用验证)、以及 Google 和 xAI 的计数接口。为计算这些数量未生成任何文本。

这些测量是我们的;文本由 AI 辅助起草,由人类编辑。于 2026-07-14 更新,增加了 TL;DR、更加简洁的表述,以及基于读者反馈增加了有关输入分词无法捕捉内容的部分。

Playcode 将这些模型保持在一个点击之内,因此你可以在两个模型上运行相同的提示,并比较重要的结果——它构建的应用,而不是关于贴纸争论。试试它:playcode.io:https://playcode.io。

后续:相同模型,一个苛刻的绘图任务,每个任务的真实成本。

对三大家庭 AI 在真实编码任务上的长篇比较。

三种新 GPT-5.6 层级的成本及使用时机。

我们测试过的最佳界面和设计质量,以及何时值得付费使用。

我们希望听到你的意见!与我们聊天或发送电子邮件。

© 2026 Playcode。总部设在欧洲。

情报判断

Aioga 编辑摘要

文章称,同一内容在不同前沿模型的 tokenizer 下会产生不同 token 数,因此仅比较每百万 token 标价可能低估实际成本。其测试中,Claude 新 tokenizer 对英语和代码的计数增幅较明显。

背景分析

作者使用各厂商计数接口,对16组英语、代码、JSON、中文及系统提示等相同字节内容进行统计,并以真实付费请求交叉核对。GPT 的 o200k 被设为1.00倍参考,缺少实测计数的模型未纳入表格。

Aioga 观点

Aioga 判断,这篇文章的核心价值是提醒采购方将“单位 token 价格”和“同一任务产生的 token 数”同时纳入评估。不过,约32%的增幅来自作者对代理请求结构的加权结果,不宜直接外推到所有负载。

影响与后续

对以英语系统提示、工具定义、代码和 JSON 为主的代理任务,Claude 新 tokenizer 可能削弱标价下降带来的成本优势。中文样本变化较小,说明成本影响可能随语言、内容类型和请求组成而显著不同。 值得关注的是,团队可选取自身真实提示、代码、工具调用结果和输出样本,通过厂商正式计数接口测算 token,并结合输入与输出费率比较单次任务成本;同时应在促销价结束前后重新核算。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: playcode.io

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-13T21:50:30.963Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

同一份 TypeScript 文件在 GPT-5.x 上为 681 个 token,在 Claude 最新 tokenizer 下为 1,178 个,相差 1.73 倍。Ant...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-13T21:50:30.963Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。