Ghi lại bài phát biểu trong video thành văn bản thuần túy. Bản ghi âm được giải mã và chạy qua Whisper trên máy tính của bạn, nên bản ghi âm không bao giờ rời khỏi đó, và bản ghi sẽ được tải về .txt khi hoàn thành.
Cách hoạt động
- Thả một tệp âm thanh hoặc video, và đường âm thanh sẽ được giải mã trên thiết bị của bạn.
- Chọn mẫu: Nhanh (≈41 MB, tải một lần) hoặc Chính xác (≈77 MB).
- Chép lại, xem văn bản xuất hiện trực tiếp, và tải về .txt, .srt hoặc .vtt.
Câu hỏi thường gặp
- Tệp của tôi có được tải lên không?
- Không. Các mô hình và toàn bộ quá trình xử lý đều chạy ngay trong trình duyệt của bạn trên thiết bị của bạn. Bạn có thể tự kiểm tra: mở DevTools trình duyệt, theo dõi tab Mạng và xử lý một tệp: không có tệp tải lên. Sau lần truy cập đầu tiên, hầu hết các công cụ cũng hoạt động hoàn toàn ngoại tuyến.
- Độ chính xác của nó đến mức nào?
- Các mô hình là Whisper của OpenAI (nhỏ và cấp cơ bản). Khi nói rõ thì chúng rất dễ sử dụng; Giọng điệu nặng, nhiễu chéo và phòng ồn sẽ hiển thị lỗi. Hạng Accurate rõ ràng tốt hơn trên âm thanh khó.
- Ngôn ngữ nào phù hợp?
- Các mô hình này đa ngôn ngữ, và hiện tại phiên âm được thực hiện bằng tiếng Anh. Dự kiến sẽ có thêm nhiều ngôn ngữ nữa: chính mô hình này đã hỗ trợ 99 ngôn ngữ.
- Mất bao lâu?
- Trên máy có GPU hỗ trợ, âm thanh chỉ vài giây mỗi phút. Trên các máy chỉ chạy CPU, nó chậm hơn nhưng vẫn thực tế, khoảng một phần tư thời lượng bản ghi.