Skip to main content
La API de MKA1 aplica límites de tasa en base a cada clave. Cada clave de API tiene su propia cuota configurada de manera independiente — solicitudes por minuto, hora o día. Cuando una clave supera su límite, la puerta de enlace devuelve 429 Too Many Requests antes de que la solicitud llegue al modelo. No se consumen tokens ni se factura el uso.

Configuración de límites de tasa

Los límites de tasa se establecen por clave de API en el momento del aprovisionamiento. Las granularidades disponibles son: Cada configuración de límite de tasa contiene una única ventana y un máximo — una clave no puede combinar varias ventanas (por ejemplo, no se admite un tope por minuto y otro por hora en la misma clave). Los límites solo se acumulan entre niveles: un límite de tasa a nivel de organización (establecido mediante PATCH /api/v1/authentication/orgs/{orgId}/rate-limit) y un límite a nivel de clave pueden aplicarse ambos a la misma solicitud.

Demostración: limitación de tasa en acción

El siguiente ejemplo utiliza una clave de API real configurada con un límite de tasa de 1 solicitud por minuto. La primera solicitud tiene éxito, y la segunda — enviada inmediatamente después — es rechazada con HTTP 429.

Solicitud 1 — exitosa

Respuesta: HTTP 200

Solicitud 2 — limitada por tasa (enviada inmediatamente después)

Respuesta: HTTP 429
La puerta de enlace rechaza la solicitud antes de que llegue al modelo — no se consumen tokens ni se factura el uso.

Ejemplo programático

La respuesta 429

Cuando una solicitud es limitada por tasa, la puerta de enlace devuelve: El SDK de OpenAI muestra esto como un OpenAI.RateLimitError con err.status === 429. El SDK de MKA1 lanza un APIError con err.statusCode === 429.

Manejo de límites de tasa en tu aplicación

Cuando tu aplicación recibe una respuesta 429, reintenta con retroceso exponencial:

Ver también