Skip to main content
A API MKA1 impõe limites de taxa por chave. Cada chave de API tem sua própria cota configurada de forma independente — solicitações por minuto, hora ou dia. Quando uma chave excede seu limite, o gateway retorna 429 Too Many Requests antes que a solicitação chegue ao modelo. Nenhum token é consumido e nenhum uso é cobrado.

Configuração de limite de taxa

Os limites de taxa são definidos por chave de API no momento do provisionamento. As granularidades disponíveis são: Cada configuração de limite de taxa contém uma única janela e máximo — uma chave não pode combinar múltiplas janelas (por exemplo, um limite por minuto e por hora na mesma chave não é compatível). Os limites se acumulam apenas entre níveis: um limite de taxa no nível da organização (definido por meio de PATCH /api/v1/authentication/orgs/{orgId}/rate-limit) e um limite no nível da chave podem ser aplicados à mesma solicitação.

Demonstração: limitação de taxa em ação

O exemplo a seguir usa uma chave de API real configurada com um limite de taxa de 1 solicitação por minuto. A primeira solicitação é bem-sucedida, e a segunda solicitação — enviada imediatamente depois — é rejeitada com HTTP 429.

Solicitação 1 — bem-sucedida

Resposta: HTTP 200

Solicitação 2 — limitada por taxa (enviada imediatamente depois)

Resposta: HTTP 429
O gateway rejeita a solicitação antes que ela chegue ao modelo — nenhum token é consumido e nenhum uso é cobrado.

Exemplo programático

A resposta 429

Quando uma solicitação é limitada por taxa, o gateway retorna: O SDK OpenAI apresenta isso como um OpenAI.RateLimitError com err.status === 429. O SDK MKA1 lança um APIError com err.statusCode === 429.

Como lidar com limites de taxa na sua aplicação

Quando sua aplicação recebe uma resposta 429, tente novamente com recuo exponencial:

Veja também