> ## Documentation Index
> Fetch the complete documentation index at: https://docs.sub2api.ruilinlu.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Sub2API Token 计费说明

> 了解什么是 Token、输入与输出 Token 如何计费，以及如何估算 API 调用的大致成本。

本文档介绍 Sub2API 中 Token 的概念、Token 的计费方式，以及如何根据 API 响应中的用量字段来估算调用成本。

## 什么是 Token

Token 是语言模型处理文本的基本单位。在 Sub2API 中，每个 API 调用的计费基础就是 Token 数量。

### Token 与字符/词的关系

* 对于英文文本，**1 个 Token 大约对应 0.75 个英文单词**，或大约 4 个英文字符
* 对于中文文本，**1 个 Token 大约对应 1 个汉字**
* 标点符号、数字和特殊字符也会占用 Token

例如，英文句子 "Hello, world!" 大约消耗 3 个 Token，而中文句子 "你好，世界！" 大约消耗 5 个 Token。

## 输入 Token 与输出 Token

Sub2API 将 Token 分为**输入 Token** 和**输出 Token**，两者分别计费。

### 输入 Token

输入 Token 包括所有你发送给模型的文本内容：

* **系统提示（System Message）**：定义模型角色和行为
* **用户消息（User Message）**：当前发送的问题或指令
* **历史对话（History）**：在多轮对话中之前发送的消息

输入 Token 通常费用较低。

### 输出 Token

输出 Token 是模型生成的回复内容。由于生成回复需要更多的计算资源（模型需要逐个预测每个 Token），输出 Token 的费用通常高于输入 Token。

## API 响应中的用量字段

每次 API 调用成功后，响应中都会包含 `usage` 字段，显示本次调用的 Token 消耗情况：

```json theme={null}
{
  "choices": [...],
  "usage": {
    "prompt_tokens": 150,
    "completion_tokens": 80,
    "total_tokens": 230
  }
}
```

### 字段说明

| 字段                  | 含义                              |
| ------------------- | ------------------------------- |
| `prompt_tokens`     | 输入 Token 数量（包括系统提示、历史消息和当前用户消息） |
| `completion_tokens` | 输出 Token 数量（模型生成的回复）            |
| `total_tokens`      | 总 Token 数量（输入 + 输出）             |

## 费用估算示例

你可以根据返回的 Token 数量来估算每次调用的成本。

假设某模型的计费标准如下（具体价格以控制台为准）：

```text theme={null}
输入 Token 费用：TODO：请在后台确认实际配置后填写。
输出 Token 费用：TODO：请在后台确认实际配置后填写。
```

### 示例计算

一次 API 调用返回 `prompt_tokens: 200`，`completion_tokens: 150`：

```text theme={null}
输入费用 = 200 × 输入 Token 费率
输出费用 = 150 × 输出 Token 费率
总费用 = 输入费用 + 输出费用
```

<Note>
  实际费率因模型而异。请前往 Sub2API 控制台查看最新的模型价格，或参考 [模型倍率说明](/billing/model-multiplier)。
</Note>

## 如何减少 Token 消耗

以下是一些优化 Token 使用、降低费用的建议：

1. **精简系统提示**：避免冗余的内容，保持系统提示简洁明确
2. **控制历史消息长度**：在对话应用中，限制保留的历史消息数量
3. **设定 max\_tokens**：通过设置 `max_tokens` 参数限制模型回复的最大长度
4. **选择合适的模型**：对于简单任务，使用轻量级模型（如 GPT-4o-mini、Haiku 或 Flash）可以大幅降低费用

## 相关文档

<CardGroup cols={2}>
  <Card title="模型倍率" href="/billing/model-multiplier">
    了解不同模型的计费倍率差异
  </Card>

  <Card title="Cached Token" href="/billing/cached-token">
    了解如何利用缓存机制降低重复请求的成本
  </Card>

  <Card title="用量查询" href="/billing/usage-query">
    在控制台查看你的 Token 消耗明细
  </Card>
</CardGroup>
