跳到主要内容

按 o200k_base 或 cl100k_base 统计文本 token,同时查看 Unicode 码点、UTF-8 字节数与 Token ID。适合对比文本长度,不将结果冒充模型账单。

按所选编码统计原始文本,不是所有模型的通用结果,也不是账单。聊天包装、工具定义、图像和隐藏提示不计入。分词表首次加载可能稍慢。

20 / 20,000 字符

快捷键:Ctrl / ⌘ + Enter。修改输入或选项会清除旧结果。

使用说明

  1. 根据目标模型资料选择对应分词编码。
  2. 粘贴文本或载入中英混排、代码示例,点击统计 Token。
  3. 查看计数卡片与 Token ID;切换编码后重新计算。

输入与输出示例

示例输入
hello(cl100k_base)
示例输出
Token 数:1 Unicode 码点:5 UTF-8 字节:5

不同文本与不同编码的分词边界可能不同,不能用固定字数比例代替实际分词。

常见问题

这里只统计输入的原始文本,不包含聊天包装、工具定义、图片、隐藏提示或输出内容。实际计费以服务方返回的用量为准。

不能。语言、空格、标点和代码都会影响分词。ID 列表超过 200 个时只展示前 200 个,但 Token 总数仍统计完整输入。

计算依据与参考资料

使用 gpt-tokenizer 的 o200k_base 或 cl100k_base 编码对纯文本分词,同时展示码点数与 UTF-8 字节数。不包含聊天封装、图片或工具调用的额外用量。

内容核对: · 关于本站与内容说明

相关工具