Transcrivez le discours d’une vidéo en texte brut. La piste audio est décodée et passée via Whisper sur votre propre machine, donc l’enregistrement ne la quitte jamais, et la transcription se télécharge en tant que .txt une fois terminée.
Comment ça marche
- Laissez tomber un fichier audio ou une vidéo, et la piste audio est décodée sur votre appareil.
- Choisissez un modèle : Rapide (≈41 Mo, téléchargé une fois) ou Précis (≈77 Mo).
- Transcrivez, regardez le texte apparaître en direct, et téléchargez .txt, .srt ou .vtt.
Questions fréquentes
- Est-ce que mon fichier est téléchargé ?
- Non. Les modèles et tous les traitements s’exécutent dans votre navigateur sur votre propre appareil. Vous pouvez vérifier vous-même : ouvrez le DevTools de votre navigateur, surveillez l’onglet Réseau et traitez un fichier : il n’y a pas de téléchargements. Après la première visite, la plupart des outils fonctionnent aussi entièrement hors ligne.
- Quelle est sa précision ?
- Les modèles sont Whisper d’OpenAI (niveaux petits et de base). En clair, ils sont très utilisables ; Des accents forts, des diaphonies et des pièces bruyantes montreront des erreurs. Le niveau Précision est nettement meilleur en audio difficile.
- Quelles langues fonctionnent ?
- Les modèles sont multilingues et la transcription s’exécute actuellement en anglais. D’autres langages sont prévus : le modèle lui-même prend déjà en charge 99.
- Combien de temps cela prend-il ?
- Sur une machine avec un GPU supporté, quelques secondes par minute d’audio. Sur les machines uniquement CPU, c’est plus lent mais resté pratique, environ un quart de la durée de l’enregistrement.