Multimodal (Anexos)
A seção Multimodal define o que o agente faz quando uma conversa recebe uma imagem, um documento ou um áudio. Ela não habilita o clipe de anexos de uma caixa pública: essa permissão pertence à própria caixa de entrada.
Abrir e salvar a seção
Section titled “Abrir e salvar a seção”- Abra Agentes e selecione o agente.
- Na barra lateral do editor, selecione Multimodal.
- Configure separadamente os cards Imagem, Arquivos e Áudio.
- Selecione Salvar na barra inferior.
As alterações ficam em rascunho até o salvamento. Descartar restaura a configuração salva. Quando um card ainda não tem configuração gravada, o produto assume Aceitar nativamente para imagens e arquivos e Aceitar áudios para áudio.
Configurar imagens
Section titled “Configurar imagens”O card Imagem oferece três modos:
- Aceitar nativamente: envia a imagem ao modelo principal quando ele suporta visão. Confira o selo Modelo atual suporta. Se aparecer Modelo atual não suporta, não use esse modo: a versão atual descarta a imagem e acrescenta apenas um aviso técnico ao contexto do modelo, sem garantir uma explicação clara ao usuário.
- Pré-processar com outro modelo: o modelo escolhido descreve a imagem, incluindo o texto visível, e a descrição entra no contexto do agente. O seletor mostra modelos globais ativos, autorizados para pré-processamento e com suporte a visão.
- Não aceitar imagens: permite escrever uma resposta em português e outra em inglês, com até 500 caracteres cada.
O pré-processamento é útil quando o modelo principal não enxerga imagens ou quando você quer separar a leitura visual da resposta final. Ele transforma a imagem em descrição textual: o agente não recebe os pixels originais depois dessa etapa.
Configurar arquivos
Section titled “Configurar arquivos”O card Arquivos usa os mesmos três modos, mas o modo nativo depende do tipo:
- TXT, Markdown e CSV têm o texto lido diretamente;
- PDF é enviado ao modelo principal quando ele suporta arquivos; caso contrário, o sistema tenta extrair o conteúdo com o modelo padrão global;
- DOC, DOCX, XLS e XLSX são extraídos com o modelo padrão global antes de chegar ao agente;
- outro tipo aceito só segue como arquivo nativo quando o modelo principal declara suporte.
O texto extraído é limitado a 15.000 caracteres por anexo no contexto do turno. Conteúdo posterior pode ser truncado, portanto envie somente as páginas, planilhas ou trechos necessários.
Em Pré-processar com outro modelo, escolha um modelo autorizado e compatível com arquivos. Se aparecer Nenhum modelo com suporte a arquivos disponível, não salve o modo: a orientação da interface para configurar um modelo na aba Modelos não corresponde ao controle real, que depende do catálogo global administrado pela plataforma.
Em Não aceitar arquivos, preencha as mensagens PT e EN, também com até 500 caracteres.
Configurar áudio
Section titled “Configurar áudio”Aceitar áudios controla arquivos de áudio recebidos por integrações ou pela API. O áudio não é entregue nativamente ao modelo: o SquadOS usa o Whisper da OpenAI, acrescenta a transcrição ao contexto textual e registra uma etapa de processamento. A versão atual fixa o idioma da transcrição como português, inclusive em conversas EN.
Na cobrança padrão, uma transcrição bem-sucedida custa aproximadamente 13 créditos por minuto. A duração é estimada pelo tamanho e pelo tipo do arquivo, não medida pelo tempo exato de reprodução. Uma falha gera o marcador [Áudio não transcrito] para o agente e não cobra créditos de Whisper.
Ao desativar áudio, escreva as mensagens PT e EN. No Hub, isso também remove o microfone quando o agente está selecionado. O gravador do Hub é um fluxo diferente: ele transcreve no navegador para um rascunho de texto; links públicos e widgets não exibem esse gravador. Consulte Áudio e Transcrição para as diferenças por canal.
Entender a rejeição
Section titled “Entender a rejeição”Se qualquer anexo do turno estiver em um modo Não aceitar, o pipeline interrompe o turno inteiro, não chama o modelo e responde com a primeira mensagem de rejeição configurada. Isso também acontece quando o usuário enviou texto ou outro anexo aceito na mesma mensagem.
O idioma vem primeiro do locale informado pela mensagem, depois do idioma da organização; qualquer valor diferente de en usa a versão PT. A rejeição custa zero créditos e fica registrada como resposta do agente.
Preencha sempre as duas mensagens. O editor atual permite salvar campos vazios apesar da validação esperada pelo pipeline: se EN estiver vazia, a resposta cai para PT; se ambas estiverem vazias, a rejeição pode não interromper o turno como configurado.
Formatos e limites no chat
Section titled “Formatos e limites no chat”O clipe dos compositores do SquadOS aceita até cinco anexos por mensagem:
- imagens JPEG, PNG, GIF e WebP;
- PDF, TXT, Markdown, CSV, DOC, DOCX, XLS e XLSX;
- nenhum vídeo.
O arquivo final enviado ao armazenamento pode ter no máximo 4 MB. Imagens recomprimíveis podem entrar no navegador com até 10 MB e PDFs com até 25 MB, mas ambos precisam terminar com até 4 MB depois da preparação. GIFs e os demais documentos não recebem essa folga. O seletor de arquivos não aceita áudio; áudio recebido normalmente vem de um canal compatível ou da API.
Esses limites são do compositor web. Integrações externas têm validação e persistência próprias. Em uma página pública ou widget, o clipe só aparece se a caixa estiver com Permitir anexos habilitado; depois do envio, os modos do agente continuam decidindo como processar cada modalidade. Veja Interface de Chat.
Entender modelos e créditos
Section titled “Entender modelos e créditos”O modelo principal é configurado em Modelos. Os modelos do seletor de pré-processamento são uma lista separada, autorizada globalmente por capacidade.
Pré-processar imagem ou arquivo faz uma chamada adicional. A extração automática de PDF, Word ou Excel também pode chamar o modelo padrão global. Com chave OpenRouter própria, essas chamadas usam a chave da organização. Na cobrança da plataforma, a versão atual não incorpora o custo dessas extrações ao ledger de créditos da resposta; não use o total exibido como medição completa do custo multimodal.
Validar antes de publicar
Section titled “Validar antes de publicar”Depois de salvar:
- use Testar Agente ou uma conversa do Hub;
- envie um exemplo pequeno de cada modalidade habilitada;
- confirme que imagem ou arquivo produziu uma etapa de descrição/extração quando houver pré-processamento;
- teste cada modo bloqueado nos idiomas PT e EN, em uma mensagem sem outros dados importantes;
- confira o resultado extraído, principalmente nomes, números, tabelas e conteúdo próximo do limite de 15.000 caracteres.
Se um modelo de pré-processamento deixar de existir ou for desativado, o runtime não volta silenciosamente ao modo nativo: ele inclui um erro de configuração no contexto. Retorne a Multimodal, escolha outro modelo e salve novamente.