Wiki / Core Features / AudioToText

AudioToText

Atualizado por Maxime_48 · há 2 horas · Visualizações: 102

Idiomas: English Français Deutsch Español Português (Brasil) Italiano Nederlands Polski Türkçe Русский 日本語 한국어 中文

O AudioToText converte áudio em texto por meio de transcrição.

Ele é separado da gravação completa de canais de voz e pode ser usado quando o seu servidor precisa converter mensagens ou arquivos de áudio em texto legível.

A página de configurações do AudioToText: canais de transcrição, chave de API, os dois interruptores de transcrição automática e o modelo de transcrição


🎙️ O que o AudioToText faz

O AudioToText pega uma entrada de áudio compatível e gera uma transcrição.

Isso pode ajudar com:

  • Acessibilidade
  • Revisão de moderação
  • Anotações de reunião
  • Resumos de mensagens de voz
  • Registros pesquisáveis

⚙️ Configuração

Dependendo da configuração do seu servidor, o AudioToText pode exigir:

  • Um canal onde o áudio é processado
  • Uma chave de API
  • Um modelo de transcrição
  • Um endpoint de transcrição personalizado, opcional
  • Restrições de cargo ou de canal

🔌 Endpoint de transcrição personalizado

O AudioToText pode usar um endpoint de transcrição personalizado compatível com Whisper.

Isso é útil se você quiser usar o seu próprio provedor ou um serviço de transcrição auto-hospedado.

Veja Custom AI Model Endpoints para mais detalhes.


🧠 Escolhendo o modelo de transcrição

O campo Modelo de transcrição lista os modelos que o seu endpoint realmente publica (o painel pergunta a ele, em vez de mostrar uma lista escrita de memória) e mantém apenas os que sabem transcrever.

Deixe-o vazio e whisper-1 será usado, que é o que a OpenAI oferece. Se você apontar o AudioToText para o seu próprio servidor, este é o campo que importa: uma instância de faster-whisper ou distil-whisper raramente responde pelo nome whisper-1, e pedir a ela um modelo que ela não tem é o motivo habitual de um endpoint auto-hospedado não devolver nada.


↔️ Diferença para a Gravação de áudio

O AudioToText se concentra na transcrição.

A Gravação de áudio se concentra em gravar conversas em canais de voz e pode, opcionalmente, acrescentar transcrição e resumos.

Use o AudioToText quando você precisa principalmente converter áudio em texto. Use a Gravação de áudio quando precisa capturar uma sessão completa de um canal de voz.


💡 Boas práticas

  • Teste primeiro com um áudio curto.
  • Confirme que o formato do arquivo é compatível.
  • Use áudio nítido para obter melhores resultados.
  • Evite usar a transcrição em áudios privados e sensíveis, a menos que o seu servidor tenha uma política clara.
  • Revise as transcrições antes de depender delas para moderação ou anotações oficiais.