Escolha o endpoint certo
Transcreva áudio
Envie um arquivo de áudio ao endpoint de transcrição quando quiser saída de texto de um arquivo gravado. Se o seu aplicativo agir em nome de um usuário final, envie tambémX-On-Behalf-Of.
Formatos de áudio compatíveis: FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV, WebM.
Para salvar a transcrição (e o áudio de entrada) no histórico, defina store=true.
Separe locutores em uma transcrição
Se precisar de diarização, ative os dados de locutor na solicitação de transcrição. Quando ativada, a resposta pode incluir uma matrizspeakers com segmentos rotulados por locutor e metadados de tempo.
text de nível superior quando precisar de uma única transcrição combinada.
Use speakers quando precisar de legendas, alternância de turnos ou análises posteriores de locutores.
Gere fala
Use o endpoint padrão de texto em fala quando quiser um arquivo WAV completo. O corpo da resposta é áudio binário, e os cabeçalhos da resposta incluemX-Language-Code.
Para salvar o áudio gerado no histórico, defina store=true. Quando armazenada, a resposta também inclui X-Tts-Id.
Transmita fala para menor latência
Use texto em fala por streaming quando quiser que a reprodução comece antes de o arquivo de áudio completo estar pronto. Escolhamp3 para cargas menores ou pcm para áudio não compactado.
Para salvar o áudio gerado no histórico, defina store=true. Quando armazenada, a resposta inclui X-Tts-Id. A persistência do histórico para streaming ocorre conforme possível e é concluída pouco após o fim do stream, portanto uma consulta imediata por X-Tts-Id pode retornar brevemente 404. Se a persistência falhar ou for ignorada, o ID nunca será atribuído e as consultas continuarão retornando 404.
Próximas etapas
- Consulte a referência de Transcrição de fala em texto para obter detalhes da solicitação e da resposta
- Consulte a referência de Texto em fala para geração de WAV
- Consulte a referência de Texto em fala por streaming para saída de baixa latência
- Use o Modo de voz avançado para conversas em tempo real