429 Too Many Requests antes que a solicitação chegue ao modelo. Nenhum token é consumido e nenhum uso é cobrado.
Configuração de limite de taxa
Os limites de taxa são definidos por chave de API no momento do provisionamento. As granularidades disponíveis são:
Cada configuração de limite de taxa contém uma única janela e máximo — uma chave não pode combinar múltiplas janelas (por exemplo, um limite por minuto e por hora na mesma chave não é compatível). Os limites se acumulam apenas entre níveis: um limite de taxa no nível da organização (definido por meio de
PATCH /api/v1/authentication/orgs/{orgId}/rate-limit) e um limite no nível da chave podem ser aplicados à mesma solicitação.
Demonstração: limitação de taxa em ação
O exemplo a seguir usa uma chave de API real configurada com um limite de taxa de 1 solicitação por minuto. A primeira solicitação é bem-sucedida, e a segunda solicitação — enviada imediatamente depois — é rejeitada com HTTP 429.Solicitação 1 — bem-sucedida
Solicitação 2 — limitada por taxa (enviada imediatamente depois)
Exemplo programático
A resposta 429
Quando uma solicitação é limitada por taxa, o gateway retorna:
O SDK OpenAI apresenta isso como um
OpenAI.RateLimitError com err.status === 429.
O SDK MKA1 lança um APIError com err.statusCode === 429.
Como lidar com limites de taxa na sua aplicação
Quando sua aplicação recebe uma resposta 429, tente novamente com recuo exponencial:Veja também
- Autenticação para configuração da chave de API e o padrão
X-On-Behalf-Of. - Autorização para controle de acesso no nível de recurso.
- Gerar uma resposta para o formato básico da solicitação Responses.