Skip to main content
A API MKA1 pode retornar texto, áudio e imagens. Texto é a modalidade de saída padrão. Use modalities e audio para habilitar a saída de fala ou adicione a ferramenta image_generation para produzir imagens.

Tipos de saída compatíveis

Gerar áudio (texto para fala)

Solicite saída de áudio definindo modalities como {"text", "audio"} e especificando uma voz e um formato no parâmetro audio. A resposta inclui tanto a transcrição de texto quanto os dados de áudio codificados em base64.

Configuração de áudio

O áudio é sintetizado em 24 kHz, mono de 16 bits.
A resposta contém um item output_audio com o áudio codificado em base64 e uma transcrição do que foi falado:
O campo data contém o arquivo de áudio completo (268 KB neste exemplo). O campo transcript contém o texto que o modelo escolheu falar — que pode diferir ligeiramente da saída de texto.

Salvar áudio em um arquivo

Idiomas compatíveis

A saída de áudio oferece suporte à detecção automática de idioma e a mais de 20 idiomas, incluindo inglês, chinês, hindi, espanhol, árabe, bengali, português, russo, japonês, punjabi, alemão, coreano, francês, turco, italiano, tailandês, polonês, holandês, indonésio, vietnamita e urdu.

Gerar imagens

Use a ferramenta image_generation para criar imagens a partir de prompts de texto. O modelo interpreta sua mensagem, gera um prompt para o modelo de imagem e retorna o resultado.

Modelos de geração de imagens

Opções de geração de imagens

A resposta inclui um item image_generation_call com a URL da imagem gerada e o prompt revisado usado pelo modelo de imagem:
O campo result contém uma URL para a imagem gerada. O revised_prompt mostra o prompt expandido usado pelo modelo de imagem — o LLM aprimora sua breve instrução para uma descrição detalhada da imagem.

Forçar a geração de imagens

Use tool_choice para garantir que o modelo gere uma imagem em vez de responder apenas com texto.

Estrutura da saída de imagem

A matriz output da resposta contém estes itens quando uma imagem é gerada:
  1. function_call — a chamada do modelo para a ferramenta de geração de imagens com o prompt refinado
  2. image_generation_call — o resultado da geração com status: "completed" e result (URL da imagem)
  3. function_call_output — a saída bruta da ferramenta contendo a URL
  4. message — a resposta de texto do modelo descrevendo ou fazendo referência à imagem
As URLs das imagens expiram após 1 hora. Baixe-as ou armazene-as em cache se precisar de acesso de longo prazo.

APIs independentes

Para acesso direto sem passar pela API Responses, a MKA1 também fornece endpoints independentes:

API de texto para fala

O endpoint de texto para fala retorna áudio binário (audio/wav) e um cabeçalho de resposta X-Language-Code. Se você definir store: true, a resposta também incluirá um cabeçalho X-Tts-Id contendo o ID do registro de histórico armazenado.

API de imagens

Próximas etapas