AudioToText zamienia dźwięk na tekst za pomocą transkrypcji.
Jest oddzielny od pełnego nagrywania kanałów głosowych i można go używać, gdy Twój serwer potrzebuje, aby wiadomości głosowe lub pliki audio zostały zamienione na czytelny tekst.

🎙️ Co robi AudioToText
AudioToText przyjmuje obsługiwane dane audio i generuje transkrypcję.
Może to pomóc w:
- Dostępności
- Przeglądzie moderacyjnym
- Notatkach ze spotkań
- Podsumowaniach wiadomości głosowych
- Przeszukiwalnych zapisach
⚙️ Konfiguracja
W zależności od ustawień serwera AudioToText może wymagać:
- Kanału, na którym przetwarzane jest audio
- Klucza API
- Modelu transkrypcji
- Opcjonalnego niestandardowego endpointu transkrypcji
- Ograniczeń dla ról lub kanałów
🔌 Niestandardowy endpoint transkrypcji
AudioToText może korzystać z niestandardowego endpointu transkrypcji kompatybilnego z Whisper.
Przydaje się, jeśli chcesz użyć własnego dostawcy lub samodzielnie hostowanej usługi transkrypcji.
Więcej szczegółów znajdziesz w Niestandardowe endpointy modeli AI.
🧠 Wybór modelu transkrypcji
Pole Model transkrypcji wyświetla modele, które Twój endpoint faktycznie udostępnia - panel go o to pyta, zamiast pokazywać listę napisaną z pamięci - i zostawia tylko te, które potrafią transkrybować.
Zostaw je puste, a zostanie użyty whisper-1, czyli to, co udostępnia OpenAI. Jeśli skierujesz AudioToText na własny serwer, to właśnie to pole ma znaczenie: instancja faster-whisper lub distil-whisper rzadko odpowiada na nazwę whisper-1, a zażądanie modelu, którego nie ma, to zwykły powód, dla którego samodzielnie hostowany endpoint nic nie zwraca.
↔️ Różnica względem Nagrywania audio
AudioToText skupia się na transkrypcji.
Nagrywanie audio skupia się na nagrywaniu rozmów na kanałach głosowych i opcjonalnie może dodawać transkrypcję oraz podsumowania.
Użyj AudioToText, gdy głównie potrzebujesz zamienić audio na tekst. Użyj Nagrywania audio, gdy chcesz uchwycić całą sesję na kanale głosowym.
💡 Dobre praktyki
- Najpierw przetestuj na krótkim nagraniu.
- Upewnij się, że format pliku jest obsługiwany.
- Używaj wyraźnego dźwięku, aby uzyskać lepsze wyniki.
- Unikaj transkrypcji wrażliwych, prywatnych nagrań, chyba że Twój serwer ma jasne zasady.
- Przejrzyj transkrypcje, zanim zaczniesz na nich polegać w moderacji lub oficjalnych notatkach.