Skip to main content
本文档介绍 Sub2API 中 Token 的概念、Token 的计费方式,以及如何根据 API 响应中的用量字段来估算调用成本。

什么是 Token

Token 是语言模型处理文本的基本单位。在 Sub2API 中,每个 API 调用的计费基础就是 Token 数量。

Token 与字符/词的关系

  • 对于英文文本,1 个 Token 大约对应 0.75 个英文单词,或大约 4 个英文字符
  • 对于中文文本,1 个 Token 大约对应 1 个汉字
  • 标点符号、数字和特殊字符也会占用 Token
例如,英文句子 “Hello, world!” 大约消耗 3 个 Token,而中文句子 “你好,世界!” 大约消耗 5 个 Token。

输入 Token 与输出 Token

Sub2API 将 Token 分为输入 Token输出 Token,两者分别计费。

输入 Token

输入 Token 包括所有你发送给模型的文本内容:
  • 系统提示(System Message):定义模型角色和行为
  • 用户消息(User Message):当前发送的问题或指令
  • 历史对话(History):在多轮对话中之前发送的消息
输入 Token 通常费用较低。

输出 Token

输出 Token 是模型生成的回复内容。由于生成回复需要更多的计算资源(模型需要逐个预测每个 Token),输出 Token 的费用通常高于输入 Token。

API 响应中的用量字段

每次 API 调用成功后,响应中都会包含 usage 字段,显示本次调用的 Token 消耗情况:

字段说明

费用估算示例

你可以根据返回的 Token 数量来估算每次调用的成本。 假设某模型的计费标准如下(具体价格以控制台为准):

示例计算

一次 API 调用返回 prompt_tokens: 200completion_tokens: 150
实际费率因模型而异。请前往 Sub2API 控制台查看最新的模型价格,或参考 模型倍率说明

如何减少 Token 消耗

以下是一些优化 Token 使用、降低费用的建议:
  1. 精简系统提示:避免冗余的内容,保持系统提示简洁明确
  2. 控制历史消息长度:在对话应用中,限制保留的历史消息数量
  3. 设定 max_tokens:通过设置 max_tokens 参数限制模型回复的最大长度
  4. 选择合适的模型:对于简单任务,使用轻量级模型(如 GPT-4o-mini、Haiku 或 Flash)可以大幅降低费用

相关文档

模型倍率

了解不同模型的计费倍率差异

Cached Token

了解如何利用缓存机制降低重复请求的成本

用量查询

在控制台查看你的 Token 消耗明细