限制维度
AIsa 在三个维度上限制容量:TPM 会合并计算输入和输出 Token。发送 10K Token 并生成 5K Token 的请求会消耗 15K TPM。
各套餐的默认限制
端点级覆盖限制
由于上游提供商会限制吞吐量,部分端点的默认限制比账户套餐更严格:读取速率限制响应头
每个响应(包括429)都会包含以下响应头:
处理 429 响应
1
检测 429
响应体遵循标准错误结构,其中
error.type = "rate_limit_error",code 为 rate_limit_exceeded、upstream_rate_limit 或 quota_exceeded。2
遵守 `Retry-After`
下次尝试前,始终至少等待
Retry-After 指定的秒数,切勿立即重试。3
使用指数退避和抖动
完成首次等待后,每次再次遇到 429 都将延迟翻倍,并添加 ±25% 抖动,上限为 30 秒。请参阅重试示例。
4
优先排队,而不是反复重试
不要使用紧密的重试循环。将请求放入队列,并以低于 RPM 的速率处理。采用
RPM/60 每秒泄漏速率的简单令牌桶即可稳定工作。5
保持在上限以内
监控每个响应中的
X-RateLimit-Remaining-*。剩余额度低于限制的 10% 时主动降速,从而避免触发 429。示例:保持在限制以内
申请提高额度
如果生产流量需要更高限制:- 为 Wallet 充值,系统会自动从免费版升级到入门版。
- 如需成长版或企业版,请发送邮件至 developer@aisa.one,并提供:
- 工作区 ID
- 预期的峰值 RPM 和 TPM
- 需要提高额度的模型或端点
- 使用场景的简要说明
相关页面
错误代码
HTTP 状态码完整列表和建议的处理方式。
用量日志
控制台中的单次请求计费和速率限制遥测数据。