Wygeneruj napisy .srt lub .vtt z dowolnego filmu, uwzględniając znaczniki czasu. Transkrypcja uruchamia się na Twoim urządzeniu z Whisper; plik napisów ładuje się bezpośrednio do odtwarzaczy, edytorów i przesyłanych na YouTube.
Jak to działa
- Wrzuć plik audio lub wideo, a ścieżka audio jest dekodowana na urządzeniu.
- Wybierz model: Fast (≈41 MB, pobrany raz) lub Accurate (≈77 MB).
- Transkrybować, obserwować wyświetlanie tekstu na żywo i pobrać .txt, .srt lub .vtt.
Najczęstsze pytania
- Czy mój plik jest przesyłany?
- Nie. Modele i całe przetwarzanie działają w Twojej przeglądarce na twoim urządzeniu. Możesz to sprawdzić sam: otwórz DevTools przeglądarki, obejrzyj zakładkę Sieć i przetworz plik: nie ma żadnych przesłań. Po pierwszej wizycie większość narzędzi działa całkowicie offline.
- Jak bardzo jest dokładny?
- Modele to Whisper od OpenAI (tiny i podstawowe poziomy). Przy wyraźnej mowie są bardzo użyteczne; Silne akcenty, przesłuchiwanie i głośne pomieszczenia będą powodować błędy. Poziom Accurate jest zauważalnie lepszy na trudnej wersji dźwiękowej.
- Które języki działają?
- Modele są wielojęzyczne, a transkrypcja obecnie odbywa się w języku angielskim. Planowane są kolejne języki: sam model już obsługuje 99.
- Ile to trwa?
- Na komputerze z obsługiwanym GPU kilka sekund na minutę dźwięku. Na komputerach działających wyłącznie na CPU jest wolniejsza, ale nadal praktyczna, około ćwierć długości nagrania.