Dlaczego do narzędzie jest przydatne
Przekształć mowę z posiadanego pliku audio lub wideo w edytowalny tekst za pomocą przypiętego wielojęzycznego modelu, który działa tylko w tej przeglądarce.
Wybierz kompletną, zatwierdzoną przez QA edycję opublikowaną dla tej witryny.
Przekształć mowę z posiadanego pliku audio lub wideo w edytowalny tekst za pomocą przypiętego wielojęzycznego modelu, który działa tylko w tej przeglądarce.
Twoje dane robocze pozostają w tej przeglądarce.
Przetwarzanie odbywa się wyłącznie za pomocą interfejsów API przeglądarki; nic nie jest przesyłane do serwisu YTSave, interfejsu API multimediów ani serwera proxy.
Przekształć mowę z posiadanego pliku audio lub wideo w edytowalny tekst za pomocą przypiętego wielojęzycznego modelu, który działa tylko w tej przeglądarce.
Przeglądarka dekoduje i miesza wybrane nagranie do monofonicznego dźwięku 16 kHz, a następnie lokalnie hostowany skwantyzowany model Whisper wykonuje ograniczone rozpoznawanie mowy w WebAssembly.
Wybierz krótki klip z wywiadu, opcjonalnie wybierz jego język mówiony, sprawdź transkrypcję pod kątem błędów rozpoznawania i pobierz zwykły tekst UTF-8.
Obliczenie jest deterministyczne i wyjaśnia błędy walidacji zamiast po cichu zmieniać nieprawidłowe dane wejściowe.
Dane wejściowe i wyjściowe pozostają w tej karcie. Kopiowanie i pobieranie odbywają się za pośrednictwem interfejsów API przeglądarki, bez przesyłania na serwer.
Każde uruchomienie zgłasza swój tryb narzędzia, znacznik czasu i rozmiar wejścia / wyjścia, dzięki czemu przekształcone dane mogą być kontrolowane.