Ekstrak teks dari seluruh PDF, baik yang dipindai maupun digital, tanpa mengirimkannya ke mana pun. Halaman digital dibaca persis dari lapisan teksnya; Halaman yang dipindai akan melalui OCR di perangkat. Ambil teks sebagai .txt, atau kembalikan seluruh dokumen sebagai PDF yang dapat dicari dan terlihat persis seperti aslinya.
Cara kerjanya
- Tinggalkan gambar atau PDF. Deteksi teks langsung jalan.
- Pilih paket bahasa Anda (diunduh sekali, 8–17 MB) dan tekan Baca teks.
- Salin barisnya, atau unduh .txt / .json. PDF dibaca dari awal hingga akhir.
Pertanyaan umum
- Apakah file saya diunggah?
- Tidak. Model dan semua pemrosesan berjalan di browser Anda di perangkat Anda sendiri. Anda dapat memverifikasi sendiri: buka DevTools browser Anda, perhatikan tab Jaringan, dan proses file: tidak ada unggahan. Setelah kunjungan pertama, sebagian besar alat juga berfungsi sepenuhnya offline.
- Bahasa apa saja yang didukung?
- 106 bahasa dalam aksara Latin, Sirilik, Arab, Devanagari, CJK, Yunani, Thailand, Tamil, dan Telugu. Bengali adalah satu-satunya kekurangan utama, karena belum ada model v5 untuk itu, dan pemilih mengatakan demikian daripada menebak.
- Seberapa akurat itu?
- Pada teks dokumen yang bersih, tingkat kesalahan karakter yang diukur di bawah 2%, dan setiap baris memiliki skor kepercayaan sehingga Anda bisa melihat mana yang harus diperiksa. Tulisan tangan dan foto beresolusi rendah akan terdengar lebih buruk.
- Apakah bisa membaca PDF hasil scan?
- Ya. PDF digital dibaca dari lapisan teks tersendiri, dengan karakter yang tepat pada posisi yang tepat. Halaman yang dipindai melewati deteksi dan pengenalan, dan dokumen campuran menggunakan keduanya.