速率限制
宁享Token API 通过 RPM(每分钟请求数)和 TPM(每分钟 Token 数)两个维度限制请求速率,保障服务稳定性。
限制维度
| 维度 | 全称 | 说明 |
|---|---|---|
| RPM | Requests Per Minute | 每分钟请求数 |
| TPM | Tokens Per Minute | 每分钟 Token 数(输入+输出) |
| 并发数 | — | 同时进行中的请求数 |
默认限制
| 等级 | RPM | TPM | 最大并发 |
|---|---|---|---|
| 免费版 | 20 | 40,000 | 2 |
| 标准版 | 60 | 150,000 | 10 |
| 专业版 | 200 | 500,000 | 30 |
| 企业版 | 1,000 | 2,000,000 | 100 |
实际限制以控制台「账户信息」页面显示为准,可联系客服提升配额。
模型级别限制
部分大模型有独立的速率限制:
| 模型 | 单独 RPM 上限 | 单独 TPM 上限 |
|---|---|---|
glm-5.2 | 60 | 150,000 |
deepseek-v4-pro | 30 | 80,000 |
kimi-k3 | 30 | 80,000 |
以上为默认值,最终以控制台显示为准。
限流响应
触发速率限制时返回 429 Too Many Requests:
json
{
"error": {
"code": "rate_limit_exceeded",
"message": "Rate limit reached. Please retry after 10 seconds.",
"type": "rate_limit_error",
"request_id": "req_abc123"
}
}响应头:
HTTP/1.1 429 Too Many Requests
Retry-After: 10
X-RateLimit-Limit-Requests: 60
X-RateLimit-Remaining-Requests: 0
X-RateLimit-Reset-Requests: 45
X-RateLimit-Limit-Tokens: 150000
X-RateLimit-Remaining-Tokens: 0| 响应头 | 说明 |
|---|---|
Retry-After | 建议等待秒数 |
X-RateLimit-Limit-Requests | 当前 RPM 上限(未配置该维度时不返回) |
X-RateLimit-Remaining-Requests | 剩余请求数 |
X-RateLimit-Reset-Requests | 距限额重置的秒数 |
X-RateLimit-Limit-Tokens | 当前 TPM 上限(未配置该维度时不返回) |
X-RateLimit-Remaining-Tokens | 剩余 Token 数 |
最佳实践
指数退避重试
遇到 429 时,使用指数退避重试:
python
import time
import requests
def call_with_retry(url, headers, json_data, max_retries=5):
for i in range(max_retries):
resp = requests.post(url, headers=headers, json=json_data)
if resp.status_code == 429:
wait = int(resp.headers.get("Retry-After", 2 ** i))
print(f"触发限流,等待 {wait} 秒后重试...")
time.sleep(wait)
continue
return resp
raise Exception("达到最大重试次数")批量请求控制
- 避免短时间内发送大量并发请求
- 使用队列处理批量任务
- 并发数控制在限制以内
Token 优化
- 精简 system prompt
- 避免超长上下文
- 启用上下文缓存以降低 TPM 消耗
- 及时清理历史消息
并发限制
并发数 = 同时处于处理中的请求数。超出并发限制会返回 429。
| 等级 | 最大并发 |
|---|---|
| 免费版 | 2 |
| 标准版 | 10 |
| 专业版 | 30 |
| 企业版 | 100 |
视频与图像任务
视频、图像生成任务不计入 RPM / TPM,但有单独的并发限制:
| 能力 | 最大并发任务数 |
|---|---|
| 视频生成 | 3 |
| 图像生成 | 10 |
| 音乐生成 | 2 |
任务排队中也会占用并发数。
提升配额
如需提升速率限制,可:
- 升级账户等级(控制台 → 账户 → 升级)
- 联系客服定制企业配额
常见问题
如何查看当前用量?
控制台 → 用量记录,实时显示 RPM / TPM 消耗。
429 后多久恢复?
通常等待 60 秒即可恢复。具体见 Retry-After 响应头。
不同模型共享 RPM 吗?
全局 RPM 共享。部分大模型有独立 RPM 限制,独立计算。
流式请求如何计 RPM?
流式请求按 1 次请求 计算 RPM,不计入多次。
