> ## Documentation Index
> Fetch the complete documentation index at: https://docs.mka1.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Registre o modelo no gateway de LLM

> Torne o modelo da implantação disponível para inferência: registre-o no registro de modelos do gateway de LLM sob o nome da implantação. A implantação deve estar pronta. O registro é deliberadamente desacoplado da implantação para que preços, orçamentos e limites de taxa possam ser configurados antes que o modelo se torne acionável.



## OpenAPI

````yaml https://apigw.mka1.com/speakeasy.json?language=pt-BR post /api/v1/serving/deployments/{deployment_id}/registration
openapi: 3.1.1
info:
  title: MKA1 API
  version: 1.1.0
  description: >-
    A API MKA1 é uma API RESTful que fornece acesso à plataforma MKA1. Aprenda
    como começar a usar a API e o SDK TypeScript
    [aqui](https://mka1.apidocumentation.com/guides/getting-started).
  license:
    name: Proprietário
servers:
  - url: https://apigw.mka1.com
    description: MKA1 API Gateway
  - url: /
    description: Relative server URL (configurable via SDK constructor)
security: []
tags:
  - name: Resource Authorization
    description: >-
      Gerencie permissões para recursos LLM. Crie recursos, conceda/revoque
      permissões e exclua recursos. Apenas os proprietários dos recursos podem
      conceder, revogar ou excluir permissões.
    x-displayName: Autorização de Recurso
  - name: Embeddings
    description: >-
      Endpoints da API de incorporação de texto para gerar representações
      vetoriais de texto. Crie incorporações semânticas para busca, clustering e
      correspondência de similaridade usando vários modelos de incorporação.
    x-displayName: Incorporações
  - name: Feedback
    description: >-
      API de feedback do usuário para avaliar e comentar sobre as conclusões de
      chat. Coleta de classificações de positivo/negativo e feedback detalhado
      para melhorar as respostas do modelo e acompanhar a satisfação do usuário.
    x-displayName: Feedback
  - name: Images
    description: >-
      Pontos de extremidade da API de geração de imagens para criar imagens a
      partir de descrições de texto. Gere imagens com controle sobre tamanho,
      qualidade e estilo.
    x-displayName: Imagens
  - name: MCP Vault
    description: >-
      API do cofre MCP para armazenar configurações de servidor MCP de
      propriedade do usuário e credenciais criptografadas. Os agentes
      referenciam IDs de cofre para que os segredos sejam resolvidos apenas no
      momento da execução da ferramenta.
    x-displayName: Cofre MCP
  - name: Speech
    description: >-
      Pontos de extremidade da API de fala para processamento de áudio. Converta
      texto em fala com som natural (TTS) ou transcreva fala em texto (STT) em
      diferentes idiomas.
    x-displayName: Discurso
  - name: Usage
    description: >-
      API de rastreamento de uso e análise para monitoramento do consumo de
      tokens, contagem de solicitações e análise de custos. Veja estatísticas
      detalhadas por usuário, modelo e período de tempo.
    x-displayName: Uso
  - name: Extract
    description: >-
      API de extração de dados estruturados para extrair informações de
      arquivos. Defina esquemas JSON para extrair dados estruturados de imagens,
      PDFs e documentos. Suporta modelos de esquema reutilizáveis.
    x-displayName: Extração
  - name: Text Classification
    description: >-
      API de classificação de texto para categorizar textos em rótulos
      predefinidos. Use modelos de IA para classificar o conteúdo textual para
      análise de sentimento, categorização de tópicos e moderação de conteúdo.
    x-displayName: Classificação de Texto
  - name: Responses
    description: >-
      API de respostas com agentes para criar agentes de IA com uso autônomo de
      ferramentas. Crie assistentes conversacionais que podem usar pesquisa na
      web, operações de arquivos, geração de imagens, execução de código,
      simulação de uso de computador e integrações MCP. Suporta processamento em
      segundo plano, streaming e monitoramento de status em tempo real.
    x-displayName: Respostas
  - name: Files
    description: >-
      API de gerenciamento de arquivos para upload, armazenamento e
      gerenciamento de arquivos com expiração automática e integração com S3.
      Faça upload de arquivos que podem ser usados com Assistentes,
      Armazenamentos Vetoriais e outras funcionalidades. Os arquivos são
      armazenados no S3 com metadados rastreados no PostgreSQL. Suporta limpeza
      automática de arquivos expirados.
    x-displayName: Arquivos
  - name: Vector Stores
    description: >-
      API de armazenamento de vetores para armazenar e pesquisar documentos
      usando embeddings. Crie armazenamentos de vetores, faça upload de arquivos
      com divisão automática e geração de embeddings, e realize pesquisas
      semânticas. Os arquivos são processados de forma assíncrona usando fluxos
      de trabalho Temporais para durabilidade. Suporta limpeza automática de
      armazenamentos expirados e LanceDB para armazenamento eficiente de
      vetores.
    x-displayName: Armazenamentos de Vetores
  - name: Conversations
    description: >-
      API de gerenciamento de conversas para armazenar e recuperar o estado da
      conversa durante chamadas à API de Resposta. Crie conversas, adicione
      itens (mensagens do usuário, mensagens do assistente, mensagens do
      sistema) e mantenha o histórico da conversa. Suporta rastreamento de
      metadados e gerenciamento de estado de diálogo em múltiplas interações.
    x-displayName: Conversa
  - name: Guardrails
    description: >-
      API de diretrizes de segurança de IA para configurar moderação de conteúdo
      e políticas de segurança. Configure listas de palavras proibidas, detecção
      de injeção de prompts e prevenção de vazamento de prompts do sistema. As
      diretrizes aplicam-se a todas as solicitações de uma conta e podem ser
      testadas antes da implementação.
    x-displayName: Guarda-corpos
  - name: Models
    description: >-
      API de listagem de modelos para descobrir modelos disponíveis. Retorna IDs
      de modelos, propriedade e metadados de todos os modelos registrados no
      gateway.
    x-displayName: Modelos
  - name: Skills
    description: >-
      API de habilidades para gerenciar pacotes versionados de instruções e
      arquivos seguindo o padrão de Habilidades do Agente. Crie, versionar e
      baixe pacotes de habilidades reutilizáveis que incluam manifestos SKILL.md
      para ambientes de agentes.
    x-displayName: Habilidades
  - name: Chat Completions
    description: >-
      **Obsoleto: Use a API de Respostas (`/api/v1/llm/responses`) em vez
      disso.** Endpoints de conclusão de chat com suporte para streaming,
      chamadas de ferramentas e múltiplos provedores.
    x-deprecated: true
    x-displayName: Conclusões de Bate-Papo
  - name: Batches
    x-displayName: Lotes
  - name: Evals
    x-displayName: Avaliações
  - name: Fine-Tuning
    x-displayName: Ajuste Fino
  - name: Memory Stores
    x-displayName: Armazenamentos de Memória
  - name: Prompts
    x-displayName: Sugestões
  - name: API Key
    x-displayName: Chave da API
  - name: Organization
    x-displayName: Organização
  - name: Cluster Admin
    x-displayName: Administrador do cluster
  - name: Sessions
    description: Crie, inspecione, acesse e encerre sessões de sandbox.
    x-displayName: Sessões
  - name: Browser
    description: >-
      Conecte-se às sessões do navegador através do proxy da porta do gateway.
      As sessões do navegador expõem um endpoint do Chrome DevTools Protocol na
      porta 9222.
    x-displayName: Navegador
  - name: Execution
    description: >-
      Executar comandos shell e código dentro de uma sessão de sandbox
      existente.
    x-displayName: Execução
  - name: Workspace
    description: >-
      Inspecione o manifesto do espaço de trabalho, transfira arquivos ou
      arquivos compactados e baixe artefatos gerados.
    x-displayName: Espaço de trabalho
  - name: Sandbox Usage
    description: >-
      Agregue estatísticas de uso da sandbox entre sessões, execução e operações
      do espaço de trabalho.
    x-displayName: Uso do Sandbox
  - name: Sandbox Pricing
    description: >-
      Gerenciamento de cluster-admin da tabela de preços de computação da
      sandbox usada para gastos orçados.
    x-displayName: Preço da Sandbox
  - name: Agents
    description: Crie e gerencie definições de agentes reutilizáveis.
    x-displayName: Agentes
  - name: Agent Versions
    description: >-
      Inspecione o histórico de configuração de um agente e reverta para uma
      versão anterior.
    x-displayName: Versões do Agente
  - name: Agent Runs
    description: Execute agentes salvos e inspecione os resultados da execução persistidos.
    x-displayName: Executa Agente
  - name: Agent Connectors
    description: >-
      Conecte agentes salvos a canais de mensagens externos, como o Telegram,
      incluindo troca de texto, foto e documentos compatíveis.
    x-displayName: Conectores de Agente
  - name: Agent Schedules
    description: Crie e gerencie execuções de agentes salvos agendadas ou recorrentes.
    x-displayName: Agendas de Agentes
  - name: schema-4_other
    x-displayName: outro
  - name: Budgets
    x-displayName: Orçamentos
  - name: Settings
    x-displayName: Configurações
  - description: Servidores de inferência de longa duração.
    name: Deployments
    x-displayName: Implantações
  - description: Enviar, monitorar e cancelar trabalhos de fine-tuning.
    name: Fine-Tune Jobs
    x-displayName: Trabalhos de Ajuste Fino
  - description: Imagens de contêiner personalizadas para implantações e jobs.
    name: Container Images
    x-displayName: Imagens de contêineres
  - description: Modelos registrados para implantação e ajuste fino.
    name: Serving Models
    x-displayName: Servindo Modelos
  - description: Armazenamento persistente para pesos e checkpoints.
    name: Volumes
    x-displayName: Volumes
  - description: Credenciais injetadas em seus workloads.
    name: Secrets
    x-displayName: Segredos
  - description: Tipos de aceleradores disponíveis (GPU, NPU, TPU).
    name: Accelerators
    x-displayName: Aceleradores
paths:
  /api/v1/serving/deployments/{deployment_id}/registration:
    post:
      tags:
        - Deployments
      summary: Registre o modelo no gateway de LLM
      description: >-
        Torne o modelo da implantação disponível para inferência: registre-o no
        registro de modelos do gateway de LLM sob o nome da implantação. A
        implantação deve estar pronta. O registro é deliberadamente desacoplado
        da implantação para que preços, orçamentos e limites de taxa possam ser
        configurados antes que o modelo se torne acionável.
      operationId: registerDeployment
      parameters:
        - in: path
          name: deployment_id
          required: true
          schema:
            title: Deployment Id
            type: string
        - name: X-On-Behalf-Of
          in: header
          required: false
          schema:
            type: string
          description: Optional external end-user identifier forwarded by the API gateway.
      responses:
        '200':
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/Deployment'
          description: Resposta Bem-Sucedida
        '401':
          description: Token bearer ausente ou inválido.
        '403':
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ServingError'
          description: O serviço não está habilitado para o seu locatário.
        '404':
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ServingError'
          description: Recurso não encontrado.
        '409':
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ServingError'
          description: >-
            Implantação não pronta, ou o nome do modelo já está em uso no
            registro.
        '422':
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ServingHTTPValidationError'
          description: Erro de Validação
      security:
        - bearerAuth: []
      x-codeSamples:
        - lang: python
          label: Python (SDK)
          source: |-
            from meetkai_mka1 import SDK


            with SDK(
                bearer_auth="<YOUR_BEARER_TOKEN_HERE>",
            ) as sdk:

                res = sdk.serving.deployments.register(deployment_id="<id>")

                # Handle response
                print(res)
        - lang: typescript
          label: Typescript (SDK)
          source: |-
            import { SDK } from "@meetkai/mka1";

            const sdk = new SDK({
              bearerAuth: "<YOUR_BEARER_TOKEN_HERE>",
            });

            async function run() {
              const result = await sdk.serving.deployments.register({
                deploymentId: "<id>",
              });

              console.log(result);
            }

            run();
        - lang: csharp
          label: CSharp (SDK)
          source: >-
            using MeetKai.MKA1;

            using MeetKai.MKA1.Types.Components;


            var sdk = new SDK(bearerAuth: "<YOUR_BEARER_TOKEN_HERE>");


            var res = await sdk.Serving.Deployments.RegisterAsync(deploymentId:
            "<id>");


            // handle response
components:
  schemas:
    Deployment:
      description: Um servidor de inferência implantado.
      properties:
        accelerator:
          $ref: '#/components/schemas/AcceleratorSpec'
        created_at:
          type: string
          format: date-time
          title: Created At
        endpoint:
          anyOf:
            - $ref: '#/components/schemas/DeploymentEndpoint'
            - type: 'null'
          description: Onde e como chamar o modelo; definido enquanto registrado no gateway
        engine:
          $ref: '#/components/schemas/Engine'
        id:
          title: Id
          type: string
        image:
          anyOf:
            - type: string
            - type: 'null'
          title: Image
        model:
          title: Model
          type: string
        name:
          title: Name
          type: string
        revision:
          description: Revisão de configuração atual
          title: Revision
          type: integer
        scaling:
          $ref: '#/components/schemas/Scaling'
        served_model_id:
          anyOf:
            - type: string
            - type: 'null'
          description: >-
            ID do modelo que os consumidores passam para os endpoints de
            inferência da gateway; definido enquanto a implantação está
            registrada com a gateway (veja Registrar), nulo quando não estiver
            registrada
          title: Served Model Id
        status:
          enum:
            - pending
            - provisioning
            - ready
            - scaling
            - updating
            - degraded
            - failed
            - stopped
            - deleted
          title: Status
          type: string
        updated_at:
          type: string
          format: date-time
          title: Updated At
      required:
        - id
        - name
        - status
        - model
        - engine
        - accelerator
        - scaling
        - image
        - revision
        - created_at
        - updated_at
      title: Deployment
      type: object
    ServingError:
      description: Envelope de erro padrão.
      properties:
        error:
          $ref: '#/components/schemas/ErrorDetail'
      required:
        - error
      title: ServingError
      type: object
    ServingHTTPValidationError:
      properties:
        detail:
          items:
            $ref: '#/components/schemas/ServingValidationError'
          title: Detail
          type: array
      title: ServingHTTPValidationError
      type: object
    AcceleratorSpec:
      description: >-
        Uma solicitação de acelerador de hardware — GPU, NPU, TPU ou مشابه.


        Solicite um acelerador por tipo e quantidade, com tipos de fallback
        opcionais.
      properties:
        count:
          default: 1
          description: Aceleradores por réplica
          maximum: 8
          minimum: 1
          title: Count
          type: integer
        fallback:
          description: Tipos de fallback em ordem se o principal não estiver disponível
          examples:
            - - H100
              - MI300X
          items:
            type: string
          title: Fallback
          type: array
        type:
          examples:
            - H100
            - MI300X
            - gaudi3
            - trn2
          title: Type
          type: string
      required:
        - type
      title: AcceleratorSpec
      type: object
    DeploymentEndpoint:
      description: >-
        Como os consumidores acessam o modelo implantado.


        A inferência sempre passa pelo gateway de LLM da MKA1: a implantação
        registra

        seu modelo lá, e os chamadores usam sua chave de API normal da MKA1. As
        URLs e

        credenciais do provedor nunca saem do plano de controle.
      properties:
        base_url:
          description: URL base do gateway para enviar solicitações de inferência
          examples:
            - https://apigw.mka1.com/api/v1/llm
          title: Base Url
          type: string
        openai_compatible:
          default: true
          title: Openai Compatible
          type: boolean
        via:
          const: gateway
          default: gateway
          title: Via
          type: string
      required:
        - base_url
      title: DeploymentEndpoint
      type: object
    Engine:
      description: Motor de inferência que dá suporte a uma implantação.
      enum:
        - vllm
        - sglang
      title: Engine
      type: string
    Scaling:
      description: Configuração de escalonamento automático para uma implantação.
      properties:
        buffer_containers:
          default: 0
          description: Réplicas ociosas mantidas prontas para picos
          minimum: 0
          title: Buffer Containers
          type: integer
        max_concurrent_inputs:
          default: 100
          description: Solicitações em voo que uma única réplica aceita de uma vez
          minimum: 1
          title: Max Concurrent Inputs
          type: integer
        max_containers:
          default: 1
          description: Teto de réplica
          minimum: 1
          title: Max Containers
          type: integer
        min_containers:
          default: 0
          description: Réplicas quentes para manter sempre
          minimum: 0
          title: Min Containers
          type: integer
        scaledown_window_s:
          default: 300
          description: Segundos de inatividade antes que uma réplica seja encerrada
          maximum: 1200
          minimum: 2
          title: Scaledown Window S
          type: integer
      title: Scaling
      type: object
    ErrorDetail:
      description: O corpo de uma resposta de erro.
      properties:
        code:
          examples:
            - tenant_not_provisioned
          title: Code
          type: string
        message:
          type: string
          title: Message
        type:
          examples:
            - authorization_error
          title: Type
          type: string
      required:
        - code
        - message
        - type
      title: ErrorDetail
      type: object
    ServingValidationError:
      properties:
        ctx:
          title: Context
          type: object
        input:
          title: Input
        loc:
          items:
            anyOf:
              - type: string
              - type: integer
          type: array
          title: Location
        msg:
          type: string
          title: Message
        type:
          type: string
          title: Error Type
      required:
        - loc
        - msg
        - type
      title: ServingValidationError
      type: object
  securitySchemes:
    bearerAuth:
      type: http
      scheme: bearer
      bearerFormat: API Key
      description: >-
        Gateway auth: send `Authorization: Bearer <mka1-api-key>`. For
        multi-user server-side integrations, you can also send `X-On-Behalf-Of:
        <external-user-id>`.

````