什么是 Token
Token 是语言模型处理文本的基本单位。在 Sub2API 中,每个 API 调用的计费基础就是 Token 数量。Token 与字符/词的关系
- 对于英文文本,1 个 Token 大约对应 0.75 个英文单词,或大约 4 个英文字符
- 对于中文文本,1 个 Token 大约对应 1 个汉字
- 标点符号、数字和特殊字符也会占用 Token
输入 Token 与输出 Token
Sub2API 将 Token 分为输入 Token 和输出 Token,两者分别计费。输入 Token
输入 Token 包括所有你发送给模型的文本内容:- 系统提示(System Message):定义模型角色和行为
- 用户消息(User Message):当前发送的问题或指令
- 历史对话(History):在多轮对话中之前发送的消息
输出 Token
输出 Token 是模型生成的回复内容。由于生成回复需要更多的计算资源(模型需要逐个预测每个 Token),输出 Token 的费用通常高于输入 Token。API 响应中的用量字段
每次 API 调用成功后,响应中都会包含usage 字段,显示本次调用的 Token 消耗情况:
字段说明
费用估算示例
你可以根据返回的 Token 数量来估算每次调用的成本。 假设某模型的计费标准如下(具体价格以控制台为准):示例计算
一次 API 调用返回prompt_tokens: 200,completion_tokens: 150:
实际费率因模型而异。请前往 Sub2API 控制台查看最新的模型价格,或参考 模型倍率说明。
如何减少 Token 消耗
以下是一些优化 Token 使用、降低费用的建议:- 精简系统提示:避免冗余的内容,保持系统提示简洁明确
- 控制历史消息长度:在对话应用中,限制保留的历史消息数量
- 设定 max_tokens:通过设置
max_tokens参数限制模型回复的最大长度 - 选择合适的模型:对于简单任务,使用轻量级模型(如 GPT-4o-mini、Haiku 或 Flash)可以大幅降低费用
相关文档
模型倍率
了解不同模型的计费倍率差异
Cached Token
了解如何利用缓存机制降低重复请求的成本
用量查询
在控制台查看你的 Token 消耗明细

