위키 / Core Features / AudioToText

AudioToText

업데이트한 사람 Maxime_48 · 3시간 전 · 조회수: 109

언어: English Français Deutsch Español Português (Brasil) Italiano Nederlands Polski Türkçe Русский 日本語 한국어 中文

AudioToText는 음성을 텍스트로 변환해 주는 기능이에요.

음성 채널 전체 녹음과는 별개이며, 서버에서 오디오 메시지나 파일을 읽을 수 있는 텍스트로 바꾸고 싶을 때 쓸 수 있어요.

AudioToText 설정 페이지: 텍스트 변환 채널, API 키, 두 개의 자동 변환 스위치, 텍스트 변환 모델


🎙️ AudioToText가 하는 일

AudioToText는 지원되는 오디오 입력을 받아 텍스트로 변환해요.

이런 경우에 도움이 돼요.

  • 접근성
  • 모더레이션 검토
  • 회의록
  • 음성 메시지 요약
  • 검색 가능한 기록

⚙️ 설정

서버 환경에 따라 AudioToText에 다음이 필요할 수 있어요.

  • 오디오를 처리할 채널
  • API 키
  • 텍스트 변환 모델
  • 선택 사항인 사용자 지정 텍스트 변환 엔드포인트
  • 역할 또는 채널 제한

🔌 사용자 지정 텍스트 변환 엔드포인트

AudioToText는 Whisper 호환 사용자 지정 텍스트 변환 엔드포인트를 사용할 수 있어요.

직접 쓰는 제공자나 자체 호스팅한 텍스트 변환 서비스를 쓰고 싶을 때 유용해요.

자세한 내용은 Custom AI Model Endpoints를 참고하세요.


🧠 텍스트 변환 모델 고르기

텍스트 변환 모델 필드에는 여러분의 엔드포인트가 실제로 제공하는 모델이 표시돼요. 기억에 의존해 적어 둔 목록이 아니라 패널이 엔드포인트에 직접 물어보고, 그중 텍스트 변환이 가능한 모델만 남겨요.

비워 두면 OpenAI가 제공하는 whisper-1을 사용해요. AudioToText를 직접 운영하는 서버에 연결했다면 이 필드가 중요해요. faster-whisper나 distil-whisper 인스턴스는 whisper-1이라는 이름에 응답하지 않는 경우가 많고, 갖고 있지 않은 모델을 요청하는 것이 자체 호스팅 엔드포인트가 아무것도 돌려주지 않는 흔한 이유예요.


↔️ 오디오 녹음과의 차이

AudioToText는 텍스트 변환에 집중해요.

오디오 녹음은 음성 채널 대화를 녹음하는 데 집중하며, 필요하면 텍스트 변환과 요약을 더할 수 있어요.

주로 오디오를 텍스트로 바꾸고 싶다면 AudioToText를, 음성 채널 세션 전체를 담고 싶다면 오디오 녹음을 사용하세요.


💡 모범 사례

  • 짧은 오디오로 먼저 테스트하세요.
  • 파일 형식이 지원되는지 확인하세요.
  • 음질이 좋을수록 결과도 좋아요.
  • 서버에 명확한 정책이 없다면 민감한 비공개 오디오에는 텍스트 변환을 쓰지 마세요.
  • 모더레이션이나 공식 기록에 활용하기 전에 변환 결과를 검토하세요.