O AudioToText converte áudio em texto por meio de transcrição.
Ele é separado da gravação completa de canais de voz e pode ser usado quando o seu servidor precisa converter mensagens ou arquivos de áudio em texto legível.

🎙️ O que o AudioToText faz
O AudioToText pega uma entrada de áudio compatível e gera uma transcrição.
Isso pode ajudar com:
- Acessibilidade
- Revisão de moderação
- Anotações de reunião
- Resumos de mensagens de voz
- Registros pesquisáveis
⚙️ Configuração
Dependendo da configuração do seu servidor, o AudioToText pode exigir:
- Um canal onde o áudio é processado
- Uma chave de API
- Um modelo de transcrição
- Um endpoint de transcrição personalizado, opcional
- Restrições de cargo ou de canal
🔌 Endpoint de transcrição personalizado
O AudioToText pode usar um endpoint de transcrição personalizado compatível com Whisper.
Isso é útil se você quiser usar o seu próprio provedor ou um serviço de transcrição auto-hospedado.
Veja Custom AI Model Endpoints para mais detalhes.
🧠 Escolhendo o modelo de transcrição
O campo Modelo de transcrição lista os modelos que o seu endpoint realmente publica (o painel pergunta a ele, em vez de mostrar uma lista escrita de memória) e mantém apenas os que sabem transcrever.
Deixe-o vazio e whisper-1 será usado, que é o que a OpenAI oferece. Se você apontar o AudioToText para o seu próprio servidor, este é o campo que importa: uma instância de faster-whisper ou distil-whisper raramente responde pelo nome whisper-1, e pedir a ela um modelo que ela não tem é o motivo habitual de um endpoint auto-hospedado não devolver nada.
↔️ Diferença para a Gravação de áudio
O AudioToText se concentra na transcrição.
A Gravação de áudio se concentra em gravar conversas em canais de voz e pode, opcionalmente, acrescentar transcrição e resumos.
Use o AudioToText quando você precisa principalmente converter áudio em texto. Use a Gravação de áudio quando precisa capturar uma sessão completa de um canal de voz.
💡 Boas práticas
- Teste primeiro com um áudio curto.
- Confirme que o formato do arquivo é compatível.
- Use áudio nítido para obter melhores resultados.
- Evite usar a transcrição em áudios privados e sensíveis, a menos que o seu servidor tenha uma política clara.
- Revise as transcrições antes de depender delas para moderação ou anotações oficiais.