AudioToTextは、文字起こしによって音声をテキストに変換します。
ボイスチャンネル全体の録音とは別の機能で、サーバーで音声メッセージやファイルを読めるテキストに変換したいときに使えます。

🎙️ AudioToTextでできること
AudioToTextは、対応する音声の入力を受け取り、文字起こしを生成します。
次のような場面で役立ちます。
- アクセシビリティ
- モデレーションの確認
- 会議のメモ
- ボイスメッセージの要約
- 検索できる記録
⚙️ 設定
サーバーの構成によっては、AudioToTextで次のものが必要になることがあります。
- 音声を処理するチャンネル
- APIキー
- 文字起こしモデル
- 任意:カスタム文字起こしエンドポイント
- ロールやチャンネルの制限
🔌 カスタム文字起こしエンドポイント
AudioToTextは、Whisper互換のカスタム文字起こしエンドポイントを使えます。
独自のプロバイダーやセルフホストの文字起こしサービスを使いたい場合に便利です。
詳しくはカスタムAIモデルのエンドポイントをご覧ください。
🧠 文字起こしモデルの選び方
文字起こしモデルの欄には、エンドポイントが実際に公開しているモデルが一覧表示されます。パネルが記憶から書いた一覧を見せるのではなく、エンドポイントに問い合わせて、文字起こしができるものだけを残します。
空欄のままにするとwhisper-1が使われます。これはOpenAIが提供しているモデルです。AudioToTextを自分のサーバーに向ける場合は、この欄が重要になります。faster-whisperやdistil-whisperのインスタンスは、whisper-1という名前では応答しないことが多く、持っていないモデルを要求することが、セルフホストのエンドポイントが何も返さない原因としてよくあります。
↔️ 音声録音との違い
AudioToTextは、文字起こしに特化しています。
音声録音は、ボイスチャンネルでの会話の録音に特化しており、必要に応じて文字起こしや要約を加えられます。
主に音声をテキストに変換したいときはAudioToText、ボイスチャンネルのセッション全体を記録したいときは音声録音を使ってください。
💡 ベストプラクティス
- まずは短い音声でテストしましょう。
- ファイル形式が対応していることを確認しましょう。
- きれいな音声のほうが、よい結果が得られます。
- サーバーに明確な方針がない限り、機密性の高い非公開の音声には文字起こしを使わないでください。
- モデレーションや公式の記録に頼る前に、文字起こしを確認しましょう。