Transforme a fala em texto e legendas com o Whisper rodando inteiramente no seu navegador. A gravação nunca sai da sua máquina, o que é o que importa mais para exatamente as gravações que as pessoas precisam transcrever: entrevistas, reuniões, ditado, áudio jurídico e médico.
Como funciona
- Coloque um arquivo de áudio ou um vídeo, e a faixa de áudio será decodificada no seu dispositivo.
- Escolha um modelo: Rápido (≈41 MB, baixado uma vez) ou Preciso (≈77 MB).
- Transcreva, assista ao texto aparecer ao vivo e baixe .txt, .srt ou .vtt.
Perguntas frequentes
- Meu arquivo é enviado?
- Não. Os modelos e todo o processamento rodam dentro do seu navegador, no seu próprio dispositivo. Você pode verificar isso por conta própria: abra a DevTools do seu navegador, observe a aba Rede e processe um arquivo: não há uploads. Após a primeira visita, a maioria das ferramentas também funciona totalmente offline.
- Quão preciso é isso?
- Os modelos são o Whisper da OpenAI (níveis minúsculo e base). Em fala clara, eles são muito utilizáveis; Sotaques fortes, diafonia e ambientes barulhentos vão mostrar erros. O nível Accurate é visivelmente melhor em áudio difícil.
- Quais idiomas funcionam?
- Os modelos são multilíngues, e a transcrição atualmente roda em inglês. Mais linguagens estão planejadas: o próprio modelo já suporta 99.
- Quanto tempo leva?
- Em uma máquina com GPU suportado, alguns segundos por minuto de áudio. Em máquinas apenas com CPU, é mais lento, mas ainda prático, cerca de um quarto do tempo da gravação.