> ## Documentation Index
> Fetch the complete documentation index at: https://docs.mka1.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Transmisión de texto a voz

> Convierte texto a voz con entrega de audio en streaming en tiempo real.

**Características clave:**
- Transmisión de audio de baja latencia: la reproducción puede comenzar inmediatamente a medida que llegan los fragmentos
- Detección automática de idioma
- Compatibilidad con múltiples formatos: MP3 o PCM/WAV
- Audio de alta calidad: frecuencia de muestreo de 24 kHz, mono de 16 bits

**Cuerpo de la solicitud:**
- `text`: texto de entrada para convertir a voz - obligatorio
- `language`: código de idioma (predeterminado: "auto") - "auto" para detección automática, o códigos ISO 639-1: en, zh, hi, es, ar, bn, pt, ru, ja, pa, de, ko, fr, tr, it, th, pl, nl, id, vi, ur
- `format`: formato de audio (predeterminado: "mp3") - "mp3" para audio MPEG comprimido (96 kbps) o "pcm" para WAV sin compresión
- `model`: identificador del modelo TTS (predeterminado: "auto") - "auto" selecciona el proveedor predeterminado; un id resoluble en el registro se envía al proveedor coincidente (nota: no todos los proveedores admiten `format: "mp3"`)

**Respuesta:**
- Transmite fragmentos de audio en tiempo real
- Devuelve la cabecera `X-Language-Code` con el idioma detectado/utilizado
- `Content-Type`: `audio/mpeg` (MP3) o `audio/wav` (PCM)
- Cuando `store` es `true`, devuelve la cabecera `X-Tts-Id` con el id bajo el que se almacenará el registro del historial; la persistencia se realiza mejor esfuerzo y se completa poco después de que finalice la transmisión

**Casos de uso:**
- Aplicaciones en tiempo real que requieren reproducción de audio inmediata
- Respuestas de voz interactivas
- Escenarios de texto a voz de baja latencia



## OpenAPI

````yaml https://apigw.mka1.com/speakeasy.json?language=es post /api/v1/llm/speech/tts/stream
openapi: 3.1.1
info:
  title: MKA1 API
  version: 1.1.0
  description: >-
    La API MKA1 es una API RESTful que proporciona acceso a la plataforma MKA1.
    Aprende cómo comenzar con la API y el SDK de TypeScript
    [aquí](https://mka1.apidocumentation.com/guides/getting-started).
  license:
    name: Propietario
servers:
  - url: https://apigw.mka1.com
    description: MKA1 API Gateway
  - url: /
    description: Relative server URL (configurable via SDK constructor)
security: []
tags:
  - name: Resource Authorization
    description: >-
      Gestiona permisos para recursos LLM. Crea recursos, otorga/revoca permisos
      y elimina recursos. Solo los propietarios de recursos pueden otorgar,
      revocar o eliminar permisos.
    x-displayName: Autorización de Recursos
  - name: Embeddings
    description: >-
      Puntos finales de la API de incrustación de texto para generar
      representaciones vectoriales del texto. Crea incrustaciones semánticas
      para búsqueda, agrupamiento y coincidencia de similitudes utilizando
      varios modelos de incrustación.
    x-displayName: Incrustaciones
  - name: Feedback
    description: >-
      API de retroalimentación del usuario para calificar y comentar sobre las
      completaciones de chat. Recopila calificaciones de pulgares arriba/abajo y
      comentarios detallados para mejorar las respuestas del modelo y rastrear
      la satisfacción del usuario.
    x-displayName: Retroalimentación
  - name: Images
    description: >-
      Puntos finales de la API de generación de imágenes para crear imágenes a
      partir de descripciones de texto. Genera imágenes con control sobre el
      tamaño, la calidad y el estilo.
    x-displayName: Imágenes
  - name: MCP Vault
    description: >-
      API de bóveda MCP para almacenar configuraciones de servidor MCP propiedad
      del usuario y credenciales encriptadas. Los agentes hacen referencia a los
      ID de la bóveda para que los secretos se resuelvan solo en el momento de
      la ejecución de la herramienta.
    x-displayName: Bóveda MCP
  - name: Speech
    description: >-
      Puntos finales de la API de voz para el procesamiento de audio. Convierte
      texto en habla natural (TTS) o transcribe el habla a texto (STT) en
      diferentes idiomas.
    x-displayName: Discurso
  - name: Usage
    description: >-
      API de seguimiento de uso y análisis para monitorear el consumo de tokens,
      la cantidad de solicitudes y el análisis de costos. Visualiza estadísticas
      detalladas por usuario, modelo y período de tiempo.
    x-displayName: Uso
  - name: Extract
    description: >-
      API de extracción de datos estructurados para extraer información de
      archivos. Define esquemas JSON para extraer datos estructurados de
      imágenes, PDFs y documentos. Soporta plantillas de esquemas reutilizables.
    x-displayName: Extracción
  - name: Text Classification
    description: >-
      API de clasificación de texto para categorizar texto en etiquetas
      predefinidas. Utilice modelos de IA para clasificar el contenido del texto
      para análisis de sentimientos, categorización de temas y moderación de
      contenido.
    x-displayName: Clasificación de Texto
  - name: Responses
    description: >-
      API de respuestas impulsadas por agentes para crear agentes de IA con uso
      autónomo de herramientas. Crea asistentes conversacionales que pueden
      utilizar búsqueda en la web, operaciones con archivos, generación de
      imágenes, ejecución de código, simulación de uso de computadoras e
      integraciones de MCP. Soporta procesamiento en segundo plano, transmisión
      y seguimiento de estado en tiempo real.
    x-displayName: Respuestas
  - name: Files
    description: >-
      API de gestión de archivos para cargar, almacenar y gestionar archivos con
      expiración automática e integración con S3. Carga archivos que se pueden
      usar con Asistentes, Almacenes Vectoriales y otras funciones. Los archivos
      se almacenan en S3 con metadatos rastreados en PostgreSQL. Soporta la
      limpieza automática de archivos expirados.
    x-displayName: Archivos
  - name: Vector Stores
    description: >-
      API de almacenamiento de vectores para almacenar y buscar documentos
      utilizando incrustaciones. Crea almacenes de vectores, sube archivos con
      fragmentación automática y generación de incrustaciones, y realiza
      búsquedas semánticas. Los archivos se procesan de forma asincrónica
      utilizando flujos de trabajo de Temporal para durabilidad. Soporta
      limpieza automática de almacenes caducados y LanceDB para almacenamiento
      eficiente de vectores.
    x-displayName: Almacenes de Vectores
  - name: Conversations
    description: >-
      API de gestión de conversaciones para almacenar y recuperar el estado de
      la conversación a través de llamadas a la API de respuesta. Crea
      conversaciones, añade elementos (mensajes de usuario, mensajes del
      asistente, mensajes del sistema) y mantiene el historial de la
      conversación. Soporta seguimiento de metadatos y gestión del estado del
      diálogo en múltiples turnos.
    x-displayName: Conversaciones
  - name: Guardrails
    description: >-
      API de salvaguardias de seguridad de IA para configurar la moderación de
      contenido y las políticas de seguridad. Configura listas de palabras
      prohibidas, detección de inyección de mensajes y prevención de filtración
      de mensajes del sistema. Las salvaguardias se aplican a todas las
      solicitudes de una cuenta y se pueden probar antes del despliegue.
    x-displayName: Barandillas
  - name: Models
    description: >-
      API de listado de modelos para descubrir modelos disponibles. Devuelve IDs
      de modelos, propiedad y metadatos para todos los modelos registrados en la
      puerta de enlace.
    x-displayName: Modelos
  - name: Skills
    description: >-
      API de habilidades para gestionar paquetes de instrucciones y archivos
      versionados siguiendo el estándar de Habilidades del Agente. Crea,
      versiona y descarga paquetes de habilidades reutilizables que incluyen
      manifiestos SKILL.md para entornos de agentes.
    x-displayName: Habilidades
  - name: Chat Completions
    description: >-
      **Obsoleto: Usa la API de Respuestas (`/api/v1/llm/responses`) en su
      lugar.** Puntos finales de completación de chat con soporte para
      transmisión, llamadas a herramientas y múltiples proveedores.
    x-deprecated: true
    x-displayName: Completaciones de Chat
  - name: Batches
    x-displayName: Lotes
  - name: Evals
    x-displayName: Evaluaciones
  - name: Fine-Tuning
    x-displayName: Ajuste fino
  - name: Memory Stores
    x-displayName: Almacenes de memoria
  - name: Prompts
    x-displayName: Sugerencias
  - name: API Key
    x-displayName: Clave de API
  - name: Organization
    x-displayName: Organización
  - name: Cluster Admin
    x-displayName: Administrador de clúster
  - name: Sessions
    description: Crear, inspeccionar, acceder y terminar sesiones de sandbox.
    x-displayName: Sesiones
  - name: Browser
    description: >-
      Conéctate a las sesiones del navegador a través del proxy del puerto de la
      puerta de enlace. Las sesiones del navegador exponen un punto final del
      Protocolo de DevTools de Chrome en el puerto 9222.
    x-displayName: Navegador
  - name: Execution
    description: >-
      Ejecutar comandos de shell y código dentro de una sesión de sandbox
      existente.
    x-displayName: Ejecución
  - name: Workspace
    description: >-
      Inspeccionar el manifiesto del espacio de trabajo, transferir archivos o
      archivos comprimidos, y descargar artefactos generados.
    x-displayName: Espacio de trabajo
  - name: Sandbox Usage
    description: >-
      Agrega estadísticas de uso de sandbox entre sesiones, ejecución y
      operaciones del espacio de trabajo.
    x-displayName: Uso de Sandbox
  - name: Sandbox Pricing
    description: >-
      Gestión de administrador de clúster de la tarjeta de tarifas de cómputo
      del entorno aislado utilizada para el gasto presupuestado.
    x-displayName: Precios de Sandbox
  - name: Agents
    description: Crea y gestiona definiciones de agentes reutilizables.
    x-displayName: Agentes
  - name: Agent Versions
    description: >-
      Inspeccionar el historial de configuración de un agente y revertir a una
      versión anterior.
    x-displayName: Versiones de Agente
  - name: Agent Runs
    description: >-
      Ejecutar agentes guardados e inspeccionar los resultados de ejecución
      persistidos.
    x-displayName: Ejecuta Agentes
  - name: Agent Connectors
    description: >-
      Conecta agentes guardados a canales de mensajería externos como Telegram,
      incluyendo intercambio de texto, fotos y documentos compatibles.
    x-displayName: Conectores de agentes
  - name: Agent Schedules
    description: >-
      Crea y gestiona ejecuciones de agentes programadas o recurrentes
      guardadas.
    x-displayName: Horarios de Agentes
  - name: schema-4_other
    x-displayName: otro
  - name: Budgets
    x-displayName: Presupuestos
  - name: Settings
    x-displayName: Configuración
  - name: Compute Jobs
    x-displayName: Trabajos de computación
  - name: Compute Services
    x-displayName: Servicios de computación
  - name: Compute Catalog
    x-displayName: Catálogo de cómputo
  - name: Compute Secrets
    x-displayName: Calcular secretos
  - name: Compute Usage
    x-displayName: Uso de cómputo
  - name: Compute Tenants
    x-displayName: Calcular inquilinos
  - description: Crear, listar, leer, actualizar y eliminar repositorios.
    name: Repositories
    x-displayName: Repositorios
paths:
  /api/v1/llm/speech/tts/stream:
    post:
      tags:
        - Speech
      summary: Transmisión de texto a voz
      description: >-
        Convierte texto a voz con entrega de audio en streaming en tiempo real.


        **Características clave:**

        - Transmisión de audio de baja latencia: la reproducción puede comenzar
        inmediatamente a medida que llegan los fragmentos

        - Detección automática de idioma

        - Compatibilidad con múltiples formatos: MP3 o PCM/WAV

        - Audio de alta calidad: frecuencia de muestreo de 24 kHz, mono de 16
        bits


        **Cuerpo de la solicitud:**

        - `text`: texto de entrada para convertir a voz - obligatorio

        - `language`: código de idioma (predeterminado: "auto") - "auto" para
        detección automática, o códigos ISO 639-1: en, zh, hi, es, ar, bn, pt,
        ru, ja, pa, de, ko, fr, tr, it, th, pl, nl, id, vi, ur

        - `format`: formato de audio (predeterminado: "mp3") - "mp3" para audio
        MPEG comprimido (96 kbps) o "pcm" para WAV sin compresión

        - `model`: identificador del modelo TTS (predeterminado: "auto") -
        "auto" selecciona el proveedor predeterminado; un id resoluble en el
        registro se envía al proveedor coincidente (nota: no todos los
        proveedores admiten `format: "mp3"`)


        **Respuesta:**

        - Transmite fragmentos de audio en tiempo real

        - Devuelve la cabecera `X-Language-Code` con el idioma
        detectado/utilizado

        - `Content-Type`: `audio/mpeg` (MP3) o `audio/wav` (PCM)

        - Cuando `store` es `true`, devuelve la cabecera `X-Tts-Id` con el id
        bajo el que se almacenará el registro del historial; la persistencia se
        realiza mejor esfuerzo y se completa poco después de que finalice la
        transmisión


        **Casos de uso:**

        - Aplicaciones en tiempo real que requieren reproducción de audio
        inmediata

        - Respuestas de voz interactivas

        - Escenarios de texto a voz de baja latencia
      operationId: textToSpeechStreaming
      parameters:
        - name: X-On-Behalf-Of
          in: header
          required: false
          schema:
            type: string
          description: Optional external end-user identifier forwarded by the API gateway.
      requestBody:
        required: true
        content:
          application/json:
            schema:
              $ref: '#/components/schemas/TextToSpeechStreamingRequest'
            example:
              text: Hello, welcome to our text-to-speech service.
              language: en
              format: mp3
      responses:
        '200':
          description: >-
            Transmisión de audio en formato MP3 o PCM/WAV con encabezado de
            código de idioma
          headers:
            X-Language-Code:
              description: The language code used for speech synthesis
              schema:
                type: string
            X-Tts-Id:
              description: >-
                ID the text-to-speech history record will be stored under.
                Present only when the request set `store: true`. Persistence is
                best-effort and completes shortly after the stream ends, so an
                immediate lookup can briefly 404 — and if the write fails or is
                skipped (audio over the 25MB history cap), the id is never
                assigned and lookups keep returning 404.
              schema:
                type: string
            Content-Type:
              description: Audio format (determined by format parameter)
              schema:
                type: string
                enum:
                  - audio/mpeg
                  - audio/wav
          content:
            audio/mpeg:
              example: (binary)
              schema:
                type: string
                format: binary
                description: >-
                  MP3 audio stream (when format=mp3): 24kHz sample rate, 96 kbps
                  bitrate, 16-bit, mono
            audio/wav:
              example: (binary)
              schema:
                type: string
                format: binary
                description: >-
                  PCM/WAV audio stream (when format=pcm): 24kHz sample rate,
                  16-bit, mono
      security:
        - bearerAuth: []
      x-codeSamples:
        - lang: python
          label: Python (SDK)
          source: |-
            from meetkai_mka1 import SDK


            with SDK(
                bearer_auth="<YOUR_BEARER_TOKEN_HERE>",
            ) as sdk:

                res = sdk.llm.speech.speak_streaming(text="Hello, welcome to our text-to-speech service.", language="en", model="auto", store=False, format_="mp3")

                # Handle response
                print(res)
        - lang: typescript
          label: Typescript (SDK)
          source: |-
            import { SDK } from "@meetkai/mka1";

            const sdk = new SDK({
              bearerAuth: "<YOUR_BEARER_TOKEN_HERE>",
            });

            async function run() {
              const result = await sdk.llm.speech.speakStreaming({
                textToSpeechStreamingRequest: {
                  text: "Hello, welcome to our text-to-speech service.",
                  language: "en",
                },
              });

              console.log(result);
            }

            run();
        - lang: csharp
          label: CSharp (SDK)
          source: >-
            using MeetKai.MKA1;

            using MeetKai.MKA1.Types.Components;


            var sdk = new SDK(bearerAuth: "<YOUR_BEARER_TOKEN_HERE>");


            var res = await sdk.Llm.Speech.SpeakStreamingAsync(body: new
            MeetKai.MKA1.Types.Components.TextToSpeechStreamingRequest() {
                Text = "Hello, welcome to our text-to-speech service.",
                Language = TextToSpeechStreamingRequestLanguage.En,
            });


            // handle response
components:
  schemas:
    TextToSpeechStreamingRequest:
      type: object
      properties:
        text:
          type: string
          minLength: 1
          description: Texto de entrada para convertir a voz
        language:
          enum:
            - auto
            - en
            - zh
            - hi
            - es
            - ar
            - bn
            - pt
            - ru
            - ja
            - pa
            - de
            - ko
            - fr
            - tr
            - it
            - th
            - pl
            - nl
            - id
            - vi
            - ur
          type: string
          default: auto
          description: >-
            Código de idioma: 'auto' para detección automática, o códigos de
            idioma ISO 639-1.
        model:
          type: string
          default: auto
          description: >-
            Identificador del modelo TTS. Por defecto es 'auto', que selecciona
            el proveedor predeterminado. Los IDs resolubles en el registro
            envían al proveedor correspondiente.
          examples:
            - auto
        store:
          type: boolean
          default: false
          description: >-
            Cuando es verdadero, persiste esta generación (texto de entrada,
            parámetros y el audio generado) en el historial de texto a voz. Por
            defecto es falso.
        format:
          enum:
            - mp3
            - pcm
          type: string
          default: mp3
          description: >-
            Formato de salida de audio: 'mp3' para audio MPEG (predeterminado),
            o 'pcm' para PCM/WAV sin comprimir (24 kHz, 16 bits, mono)
      required:
        - text
      description: >-
        Parámetros de solicitud para la conversión de texto a voz en streaming
        con selección de idioma y opciones de formato.
  securitySchemes:
    bearerAuth:
      type: http
      scheme: bearer
      bearerFormat: API Key
      description: >-
        Gateway auth: send `Authorization: Bearer <mka1-api-key>`. For
        multi-user server-side integrations, you can also send `X-On-Behalf-Of:
        <external-user-id>`.

````