Skip to content

速率限制 ​

宁享Token API 通过 RPM(每分钟请求数)和 TPM(每分钟 Token 数)两个维度限制请求速率,保障服务稳定性。

限制维度 ​

维度全称说明
RPMRequests Per Minute每分钟请求数
TPMTokens Per Minute每分钟 Token 数(输入+输出)
并发数—同时进行中的请求数

默认限制 ​

等级RPMTPM最大并发
免费版2040,0002
标准版60150,00010
专业版200500,00030
企业版1,0002,000,000100

实际限制以控制台「账户信息」页面显示为准,可联系客服提升配额。

模型级别限制 ​

部分大模型有独立的速率限制:

模型单独 RPM 上限单独 TPM 上限
glm-5.260150,000
deepseek-v4-pro3080,000
kimi-k33080,000

以上为默认值,最终以控制台显示为准。

限流响应 ​

触发速率限制时返回 429 Too Many Requests:

json
{
  "error": {
    "code": "rate_limit_exceeded",
    "message": "Rate limit reached. Please retry after 10 seconds.",
    "type": "rate_limit_error",
    "request_id": "req_abc123"
  }
}

响应头:

HTTP/1.1 429 Too Many Requests
Retry-After: 10
X-RateLimit-Limit-Requests: 60
X-RateLimit-Remaining-Requests: 0
X-RateLimit-Reset-Requests: 45
X-RateLimit-Limit-Tokens: 150000
X-RateLimit-Remaining-Tokens: 0
响应头说明
Retry-After建议等待秒数
X-RateLimit-Limit-Requests当前 RPM 上限(未配置该维度时不返回)
X-RateLimit-Remaining-Requests剩余请求数
X-RateLimit-Reset-Requests距限额重置的秒数
X-RateLimit-Limit-Tokens当前 TPM 上限(未配置该维度时不返回)
X-RateLimit-Remaining-Tokens剩余 Token 数

最佳实践 ​

指数退避重试 ​

遇到 429 时,使用指数退避重试:

python
import time
import requests

def call_with_retry(url, headers, json_data, max_retries=5):
    for i in range(max_retries):
        resp = requests.post(url, headers=headers, json=json_data)
        if resp.status_code == 429:
            wait = int(resp.headers.get("Retry-After", 2 ** i))
            print(f"触发限流,等待 {wait} 秒后重试...")
            time.sleep(wait)
            continue
        return resp
    raise Exception("达到最大重试次数")

批量请求控制 ​

  • 避免短时间内发送大量并发请求
  • 使用队列处理批量任务
  • 并发数控制在限制以内

Token 优化 ​

  • 精简 system prompt
  • 避免超长上下文
  • 启用上下文缓存以降低 TPM 消耗
  • 及时清理历史消息

并发限制 ​

并发数 = 同时处于处理中的请求数。超出并发限制会返回 429。

等级最大并发
免费版2
标准版10
专业版30
企业版100

视频与图像任务 ​

视频、图像生成任务不计入 RPM / TPM,但有单独的并发限制:

能力最大并发任务数
视频生成3
图像生成10
音乐生成2

任务排队中也会占用并发数。

提升配额 ​

如需提升速率限制,可:

  1. 升级账户等级(控制台 → 账户 → 升级)
  2. 联系客服定制企业配额

常见问题 ​

如何查看当前用量? ​

控制台 → 用量记录,实时显示 RPM / TPM 消耗。

429 后多久恢复? ​

通常等待 60 秒即可恢复。具体见 Retry-After 响应头。

不同模型共享 RPM 吗? ​

全局 RPM 共享。部分大模型有独立 RPM 限制,独立计算。

流式请求如何计 RPM? ​

流式请求按 1 次请求 计算 RPM,不计入多次。

相关文档 ​

© 2026 宁享Token. 保留所有权利。