Wiki / Core Features / AudioToText

AudioToText

Actualizado por Maxime_48 · hace 2 horas · Visitas: 100

Idiomas: English Français Deutsch Español Português (Brasil) Italiano Nederlands Polski Türkçe Русский 日本語 한국어 中文

AudioToText convierte audio en texto mediante transcripción.

Es independiente de la grabación completa de canales de voz y se puede usar cuando tu servidor necesita convertir mensajes o archivos de audio en texto legible.

La página de ajustes de AudioToText: canales de transcripción, clave de API, los dos interruptores de transcripción automática y el modelo de transcripción


🎙️ Qué hace AudioToText

AudioToText toma una entrada de audio compatible y genera una transcripción.

Esto puede ayudar con:

  • Accesibilidad
  • Revisión de moderación
  • Notas de reuniones
  • Resúmenes de mensajes de voz
  • Registros en los que se puede buscar

⚙️ Configuración

Según la configuración de tu servidor, AudioToText puede requerir:

  • Un canal donde se procesa el audio
  • Una clave de API
  • Un modelo de transcripción
  • Un endpoint de transcripción personalizado (opcional)
  • Restricciones por rol o por canal

🔌 Endpoint de transcripción personalizado

AudioToText puede usar un endpoint de transcripción personalizado compatible con Whisper.

Es útil si quieres usar tu propio proveedor o un servicio de transcripción autoalojado.

Consulta Custom AI Model Endpoints para más detalles.


🧠 Elegir el modelo de transcripción

El campo Modelo de transcripción lista los modelos que tu endpoint publica realmente (el panel se lo pregunta, en lugar de mostrar una lista escrita de memoria) y se queda solo con los que pueden transcribir.

Si lo dejas vacío, se usa whisper-1, que es lo que sirve OpenAI. Si apuntas AudioToText a tu propio servidor, este es el campo que importa: una instancia de faster-whisper o distil-whisper rara vez responde al nombre whisper-1, y pedirle un modelo que no tiene es el motivo habitual de que un endpoint autoalojado no devuelva nada.


↔️ Diferencia con la Grabación de audio

AudioToText se centra en la transcripción.

La Grabación de audio se centra en grabar las conversaciones de los canales de voz y, opcionalmente, puede añadir transcripción y resúmenes.

Usa AudioToText cuando sobre todo necesites convertir audio en texto. Usa la Grabación de audio cuando necesites capturar una sesión completa de un canal de voz.


💡 Buenas prácticas

  • Prueba primero con audios cortos.
  • Asegúrate de que el formato de archivo es compatible.
  • Usa audio claro para obtener mejores resultados.
  • Evita usar la transcripción con audios privados sensibles, salvo que tu servidor tenga una política clara.
  • Revisa las transcripciones antes de basarte en ellas para moderar o para notas oficiales.