modalities e audio para habilitar a saída de fala ou adicione a ferramenta image_generation para produzir imagens.
Tipos de saída compatíveis
Gerar áudio (texto para fala)
Solicite saída de áudio definindomodalities como {"text", "audio"} e especificando uma voz e um formato no parâmetro audio. A resposta inclui tanto a transcrição de texto quanto os dados de áudio codificados em base64.
Configuração de áudio
O áudio é sintetizado em 24 kHz, mono de 16 bits.
output_audio com o áudio codificado em base64 e uma transcrição do que foi falado:
data contém o arquivo de áudio completo (268 KB neste exemplo). O campo transcript contém o texto que o modelo escolheu falar — que pode diferir ligeiramente da saída de texto.
Salvar áudio em um arquivo
Idiomas compatíveis
A saída de áudio oferece suporte à detecção automática de idioma e a mais de 20 idiomas, incluindo inglês, chinês, hindi, espanhol, árabe, bengali, português, russo, japonês, punjabi, alemão, coreano, francês, turco, italiano, tailandês, polonês, holandês, indonésio, vietnamita e urdu.Gerar imagens
Use a ferramentaimage_generation para criar imagens a partir de prompts de texto. O modelo interpreta sua mensagem, gera um prompt para o modelo de imagem e retorna o resultado.
Modelos de geração de imagens
Opções de geração de imagens
image_generation_call com a URL da imagem gerada e o prompt revisado usado pelo modelo de imagem:
result contém uma URL para a imagem gerada. O revised_prompt mostra o prompt expandido usado pelo modelo de imagem — o LLM aprimora sua breve instrução para uma descrição detalhada da imagem.
Forçar a geração de imagens
Usetool_choice para garantir que o modelo gere uma imagem em vez de responder apenas com texto.
Estrutura da saída de imagem
A matrizoutput da resposta contém estes itens quando uma imagem é gerada:
function_call— a chamada do modelo para a ferramenta de geração de imagens com o prompt refinadoimage_generation_call— o resultado da geração comstatus: "completed"eresult(URL da imagem)function_call_output— a saída bruta da ferramenta contendo a URLmessage— a resposta de texto do modelo descrevendo ou fazendo referência à imagem
APIs independentes
Para acesso direto sem passar pela API Responses, a MKA1 também fornece endpoints independentes:API de texto para fala
O endpoint de texto para fala retorna áudio binário (audio/wav) e um cabeçalho de resposta X-Language-Code.
Se você definir store: true, a resposta também incluirá um cabeçalho X-Tts-Id contendo o ID do registro de histórico armazenado.
API de imagens
Próximas etapas
- Entrada multimodal — envie imagens, áudio e documentos ao modelo
- Fala — transcreva áudio e gere fala com os endpoints de fala independentes
- Modo de voz avançado — conversas de voz em tempo real com LiveKit
- Gerar uma resposta — solicitações de texto e trocas de múltiplos turnos