API 调用速率限制说明
PilotAIHub 在网关边缘执行的限流维度、默认配额、超限行为与调整方式。
执行位置
所有限流在网关边缘同步执行,不缓冲 SSE 流式响应。超限请求立即返回错误,不会排队等待。
默认限流配额
每个账号创建后默认适用以下限流配额。PilotAIHub 不划分多级限流层级,所有用户共享同一套默认配额。 如需提高限流,请联系商务申请扩容。
| 维度 | 默认值 | 作用域 | 说明 |
|---|---|---|---|
| RPM | 100 | 用户级 / Key 级 | 每分钟请求数上限。用户级是账号总上限,Key 级是单 Key 上限,二者取较小值生效。 |
| TPM | 100,000 | 用户级 / Key 级 | 每分钟 Token 数上限。统计输入+输出 Token,超限请求被拒绝。 |
| 并发 | 50 | Key 级 | 单 Key 最大在途请求数。控制并发防止下游过载。 |
如需提高限流
以上为系统默认配额,适用于绝大多数应用场景。若您的业务有更高吞吐需求, 请 联系商务 申请专属扩容方案,我们将根据实际业务量为您调整 RPM / TPM / 并发上限。
限流维度说明
| 维度 | 说明 |
|---|---|
| RPM | 每分钟请求数(Requests Per Minute)。用户级与 Key 级同时生效,取较小值。 |
| TPM | 每分钟 Token 数(Tokens Per Minute)。统计输入+输出 Token,按实际用量计扣。 |
| 并发 | 单 Key 最大在途请求数。超过并发上限的请求进入排队,排队超时则返回 queue_timeout。 |
| 模型范围 | 限定 Key 可调用的模型集合,未列入的模型返回 403 model_not_allowed。 |
| 月度预算 | 消费达到预算阈值告警,超限按配置行为处理(block 阻断 / warn 告警 / fallback 降级)。 |
超限行为
当请求超出任一限流维度时,网关返回 HTTP 429 Too Many Requests, 响应体包含错误码与说明:
429 响应示例
{
"error": {
"message": "RPM limit exceeded",
"type": "rate_limit_error",
"code": "rate_limited",
"param": null
}
}重试建议
收到 429 后应采用指数退避重试,而非立即重试。PilotAIHub 在响应头返回
Retry-After(秒), 建议按此值等待。完整错误码说明请参考 错误码说明。不可绕过
限流在网关边缘执行,客户端无法通过修改请求头或并发规避。如需更高限额,请联系商务调整用户级上限。