Convierte el habla en texto y subtítulos con Whisper funcionando completamente en tu navegador. La grabación nunca sale de tu máquina, lo cual es lo más importante para las grabaciones que la gente necesita transcribir: entrevistas, reuniones, dictado, audio legal y médico.
Cómo funciona
- Suelta un archivo de audio o un vídeo, y la pista de audio se decodifica en tu dispositivo.
- Elige un modelo: Rápido (≈41 MB, descargado una vez) o Preciso (≈77 MB).
- Transcríbe, observa cómo el texto aparece en directo y descarga .txt, .srt o .vtt.
Preguntas frecuentes
- ¿Mi archivo se sube?
- No. Los modelos y todo el procesamiento se ejecutan dentro de tu navegador en tu propio dispositivo. Puedes comprobarlo tú mismo: abre la DevTools de tu navegador, mira la pestaña de Red y procesa un archivo: no hay subidas. Después de la primera visita, la mayoría de las herramientas también funcionan completamente offline.
- ¿Qué tan precisa es?
- Los modelos son Whisper de OpenAI (niveles pequeños y base). En voz clara son muy utilizables; Los acentos fuertes, la diafonía y las habitaciones ruidosas mostrarán errores. El nivel Preciso es notablemente mejor en audio difícil.
- ¿Qué idiomas funcionan?
- Los modelos son multilingües y la transcripción actualmente se realiza en inglés. Se planifican más lenguajes: el propio modelo ya soporta 99.
- ¿Cuánto tiempo tarda?
- En una máquina con GPU soportado, unos segundos por minuto de audio. En máquinas solo con CPU es más lenta pero sigue siendo práctica, alrededor de una cuarta parte de la duración de la grabación.