API 调用速率限制说明

PilotAIHub 在网关边缘执行的限流维度、默认配额、超限行为与调整方式。

执行位置

所有限流在网关边缘同步执行,不缓冲 SSE 流式响应。超限请求立即返回错误,不会排队等待。

默认限流配额

每个账号创建后默认适用以下限流配额。PilotAIHub 不划分多级限流层级,所有用户共享同一套默认配额。 如需提高限流,请联系商务申请扩容。

维度默认值作用域说明
RPM100用户级 / Key 级每分钟请求数上限。用户级是账号总上限,Key 级是单 Key 上限,二者取较小值生效。
TPM100,000用户级 / Key 级每分钟 Token 数上限。统计输入+输出 Token,超限请求被拒绝。
并发50Key 级单 Key 最大在途请求数。控制并发防止下游过载。

如需提高限流

以上为系统默认配额,适用于绝大多数应用场景。若您的业务有更高吞吐需求, 请 联系商务 申请专属扩容方案,我们将根据实际业务量为您调整 RPM / TPM / 并发上限。

限流维度说明

维度说明
RPM每分钟请求数(Requests Per Minute)。用户级与 Key 级同时生效,取较小值。
TPM每分钟 Token 数(Tokens Per Minute)。统计输入+输出 Token,按实际用量计扣。
并发单 Key 最大在途请求数。超过并发上限的请求进入排队,排队超时则返回 queue_timeout。
模型范围限定 Key 可调用的模型集合,未列入的模型返回 403 model_not_allowed。
月度预算消费达到预算阈值告警,超限按配置行为处理(block 阻断 / warn 告警 / fallback 降级)。

超限行为

当请求超出任一限流维度时,网关返回 HTTP 429 Too Many Requests, 响应体包含错误码与说明:

429 响应示例
{
  "error": {
    "message": "RPM limit exceeded",
    "type": "rate_limit_error",
    "code": "rate_limited",
    "param": null
  }
}

重试建议

收到 429 后应采用指数退避重试,而非立即重试。PilotAIHub 在响应头返回 Retry-After(秒), 建议按此值等待。完整错误码说明请参考 错误码说明

不可绕过

限流在网关边缘执行,客户端无法通过修改请求头或并发规避。如需更高限额,请联系商务调整用户级上限。