Pular para o conteúdo

Áudio e Transcrição

O SquadOS trabalha com áudio de duas formas diferentes:

  • Gravação no Hub: sua fala é transcrita e acrescentada ao campo de mensagem. Você revisa o texto e só então o envia. A gravação não é enviada como mensagem.
  • Áudio recebido pelo agente: um canal ou a API entrega um arquivo de áudio. O SquadOS o transcreve, adiciona o texto ao contexto do agente e mantém o anexo no histórico da conversa.

As duas formas usam o Whisper da OpenAI com o idioma configurado como português, mas têm disponibilidade, armazenamento e cobrança diferentes.

ContextoMicrofone para gravarRegra atual
Hub, com um agente selecionadoSim, quando Aceitar áudios está ligadoA configuração do agente controla o botão
Hub, sem agente selecionadoSimO gravador permanece disponível
Conversas, durante intervenção humanaSimLimitação atual: o botão pode aparecer mesmo quando o agente não aceita áudio
Link públicoNãoVisitantes não têm sessão autenticada para a transcrição
Widget incorporadoNãoUsa o mesmo modo anônimo do link público

O botão de microfone é diferente do botão de anexo. O seletor de arquivos do navegador aceita imagens e documentos, não arquivos de áudio. Áudios recebidos normalmente chegam por uma integração compatível, como WhatsApp Oficial ou Telegram, ou pela API.

  1. No compositor do Hub ou de uma intervenção humana, selecione Gravar áudio pelo ícone de microfone.
  2. Quando o navegador pedir acesso ao microfone, escolha Permitir. O navegador, e não o SquadOS, controla se essa decisão será lembrada.
  3. Fale enquanto o compositor mostra o visualizador e a duração.
  4. Selecione Enviar áudio pelo ícone de avião. Esse controle encerra a gravação e inicia a transcrição; ele ainda não envia uma mensagem ao agente ou ao contato.
  5. Aguarde o texto aparecer no campo, revise-o e envie a mensagem normalmente.

Para descartar uma gravação ainda em andamento, selecione Cancelar gravação pelo X. Evite cancelar depois que a tela já mostrar Transcrevendo…: há uma limitação conhecida em que uma transcrição em andamento pode terminar e inserir texto mesmo após o cancelamento.

  • A gravação precisa chegar a 1 segundo. Se você tentar finalizar antes, verá Grave pelo menos 1 segundo de áudio e a gravação continuará.
  • O limite é 120 segundos. Ao alcançá-lo, o navegador encerra a gravação e a transcrição começa automaticamente.
  • O navegador solicita áudio mono a 16 kHz, com cancelamento de eco, redução de ruído e ganho automático quando o dispositivo oferece esses recursos.
  • O formato é negociado com o navegador entre WebM/Opus, WebM, Ogg/Opus, MP4 e MPEG. Você não escolhe o formato.

O texto transcrito é acrescentado ao rascunho existente. Se já houver texto, deixe um espaço no fim antes de gravar para evitar que a primeira palavra transcrita fique colada à última palavra digitada.

Nesse fluxo, o áudio existe apenas para produzir o rascunho: o arquivo gravado não entra no histórico e o fluxo não registra créditos de transcrição na conversa. Depois que você envia, somente a mensagem de texto é persistida.

Quando uma integração compatível ou a API entrega um anexo do tipo audio, o pipeline verifica a configuração do agente antes de processá-lo.

Se Aceitar áudios estiver ligado:

  1. o arquivo é preservado no armazenamento de anexos da conversa;
  2. o Whisper transcreve o conteúdo em português;
  3. a transcrição é acrescentada ao contexto textual enviado ao modelo;
  4. o processamento registra uma etapa de transcrição no histórico técnico da mensagem.

Se a transcrição falhar, o agente recebe o marcador [Áudio não transcrito] no contexto e nenhum crédito de Whisper é cobrado por aquela tentativa. O arquivo continua disponível no histórico quando a persistência do anexo foi bem-sucedida.

Na cobrança padrão da plataforma, a estimativa exibida no editor é de aproximadamente 13 créditos por minuto transcrito. A duração usada para cobrança é estimada pelo tamanho e pelo tipo do arquivo, portanto não é uma medição exata do tempo de reprodução.

  1. Abra Agentes e escolha o agente.
  2. Na barra lateral do editor, abra Multimodal.
  3. No cartão Áudio, desligue Aceitar áudios.
  4. Preencha a Mensagem ao usuário (quando desligado) em Português e Inglês.
  5. Salve as configurações de anexos.

Quando esse agente recebe áudio pelo pipeline, o SquadOS devolve a mensagem configurada em vez de transcrever o arquivo. A configuração também remove o microfone do Hub quando esse agente está selecionado. Ela não controla corretamente o gravador da intervenção humana na versão atual.

A chamada ao Whisper fixa o idioma como português. Palavras de outros idiomas podem ser reconhecidas, mas não há seletor de idioma para essa transcrição. Fale perto do microfone, evite sobreposição de vozes e revise nomes, números e termos técnicos antes de enviar.

  • O microfone não aparece no Hub: confirme que existe um agente selecionado e que Multimodal → Áudio → Aceitar áudios está ligado. Em link público e widget, a ausência do botão é esperada.
  • Erro ao gravar áudio: confirme que o dispositivo tem microfone e que o navegador permite seu uso para o site. Depois de mudar a permissão, recarregue a página.
  • Erro ao transcrever áudio. Tente novamente.: repita a gravação. A mensagem também aparece quando o Whisper não detecta fala, embora o serviço tenha respondido sem erro técnico.
  • O texto apareceu colado ao rascunho: insira o espaço que falta e revise antes de enviar.
  • O texto apareceu depois de cancelar: apague o trecho inserido. O cancelamento durante a transcrição não interrompe a requisição em andamento na versão atual.
  • O agente recusou um áudio recebido: verifique a configuração Aceitar áudios e as mensagens de recusa nos dois idiomas.