Skip to main content
Este benchmark mede quão rapidamente o streaming começa na API pública de Respostas MKA1. Ele utiliza POST /api/v1/llm/responses em https://apigw.mka1.com/api/v1/llm/responses com stream: true e modelo meetkai:functionary-pt. O objetivo é simples: medir o tempo desde o envio da requisição até o primeiro token de texto transmitido chegar ao cliente.

Resumo dos resultados

Execução do benchmark: 2026-03-31 Nesta execução, a API pública de Respostas permaneceu abaixo de 1 segundo no percentil 95 para o tempo até o primeiro token de texto transmitido.

O que TTFT significa neste benchmark

Para este benchmark, TTFT significa:
  • o cliente inicia um cronômetro imediatamente antes do envio da requisição HTTP
  • o cliente abre o stream SSE
  • o cronômetro para quando o primeiro delta de texto transmitido não vazio é recebido
Este modelo normalmente emite texto de raciocínio antes do texto da resposta final. Por isso, o benchmark conta o primeiro delta de texto não vazio de:
  • response.reasoning_text.delta
  • response.output_text.delta
Essa definição mede o início do texto transmitido de forma contínua conforme visto pelo cliente. O benchmark também relata dois marcos anteriores:
  • cabeçalhos de resposta: quando a resposta HTTP inicial é retornada
  • primeiro evento SSE: quando o primeiro frame SSE chega, independentemente do conteúdo

Configuração do benchmark

A execução ao vivo utilizou o seguinte perfil de requisição:
  • URL base: https://apigw.mka1.com
  • endpoint: POST /api/v1/llm/responses
  • autenticação: Authorization: Bearer <mka1-api-key>
  • cabeçalho de usuário final: X-On-Behalf-Of: ttft-benchmark-user
  • modelo: meetkai:functionary-pt
  • prompt: Reply with exactly the text OK and nothing else.
  • stream: true
  • temperature: 0
  • max_output_tokens: 64
  • aquecimentos: 5
  • requisições medidas: 100
  • concorrência: 1
  • timeout da requisição: 45s
Estes números são medições observadas pelo cliente contra o endpoint público da API. Portanto, incluem o tempo de ida e volta de rede entre o cliente do benchmark e apigw.mka1.com, não apenas o tempo de processamento no servidor.

Formato da requisição

O próprio benchmark utiliza um parser SSE em vez do tempo de saída do curl, para poder detectar o momento exato da chegada do primeiro token de texto transmitido.

Interpretação

Esta execução mostra três camadas úteis de latência:
  • a conexão e o gateway retornaram os cabeçalhos rapidamente, com p95 em 70.42 ms
  • o primeiro frame SSE chegou em p95 70.69 ms
  • o primeiro token de texto transmitido chegou em p95 608.49 ms
Isso significa que o stream começa quase imediatamente no nível de transporte, e o texto transmitido significativo chega ao cliente bem abaixo de 1 segundo em p95 para este modelo e perfil de requisição.

Saída completa do teste