AudioToText convierte audio en texto mediante transcripción.
Es independiente de la grabación completa de canales de voz y se puede usar cuando tu servidor necesita convertir mensajes o archivos de audio en texto legible.

🎙️ Qué hace AudioToText
AudioToText toma una entrada de audio compatible y genera una transcripción.
Esto puede ayudar con:
- Accesibilidad
- Revisión de moderación
- Notas de reuniones
- Resúmenes de mensajes de voz
- Registros en los que se puede buscar
⚙️ Configuración
Según la configuración de tu servidor, AudioToText puede requerir:
- Un canal donde se procesa el audio
- Una clave de API
- Un modelo de transcripción
- Un endpoint de transcripción personalizado (opcional)
- Restricciones por rol o por canal
🔌 Endpoint de transcripción personalizado
AudioToText puede usar un endpoint de transcripción personalizado compatible con Whisper.
Es útil si quieres usar tu propio proveedor o un servicio de transcripción autoalojado.
Consulta Custom AI Model Endpoints para más detalles.
🧠 Elegir el modelo de transcripción
El campo Modelo de transcripción lista los modelos que tu endpoint publica realmente (el panel se lo pregunta, en lugar de mostrar una lista escrita de memoria) y se queda solo con los que pueden transcribir.
Si lo dejas vacío, se usa whisper-1, que es lo que sirve OpenAI. Si apuntas AudioToText a tu propio servidor, este es el campo que importa: una instancia de faster-whisper o distil-whisper rara vez responde al nombre whisper-1, y pedirle un modelo que no tiene es el motivo habitual de que un endpoint autoalojado no devuelva nada.
↔️ Diferencia con la Grabación de audio
AudioToText se centra en la transcripción.
La Grabación de audio se centra en grabar las conversaciones de los canales de voz y, opcionalmente, puede añadir transcripción y resúmenes.
Usa AudioToText cuando sobre todo necesites convertir audio en texto. Usa la Grabación de audio cuando necesites capturar una sesión completa de un canal de voz.
💡 Buenas prácticas
- Prueba primero con audios cortos.
- Asegúrate de que el formato de archivo es compatible.
- Usa audio claro para obtener mejores resultados.
- Evita usar la transcripción con audios privados sensibles, salvo que tu servidor tenga una política clara.
- Revisa las transcripciones antes de basarte en ellas para moderar o para notas oficiales.