Telugu alfabesini bir görselden okumak. Telugu dilinde, ünsüz kümelerini ikinci ünsüzün alt simgesi olarak birincinin altına yazarak işaretler; böylece glifler bir satırda dikey olarak üst üste yığılır — bu paketin okumak için eğitildiği ve genel bir modelin yanlış yaptığı şey. Aynı sayfadaki İngilizce aynı 7.9 MB paket tarafından okunuyor.
Nasıl çalışır
- Bir resim veya PDF bırakın. Metin algılama hemen çalışıyor.
- Dil paketinizi seçin (bir kez indirildi, 8–17 MB) ve Metni O'ru tuşuna basın.
- Satırları kopyalayın veya .txt / .json indirin. PDF'ler baştan sona okunabilir.
Sık sorulan sorular
- Üst üste konsonant kümelerini yönetiyor mu?
- Evet — bu üst üste yığma, Telugu'nun başka bir Hint alfabesiyle paylaşmak yerine kendi tanıyıcısına ihtiyaç duymasının özel sebebi. Çıktı Unicode Telugu'dur, bu yüzden fontu olan herhangi bir düzenleyiciye yapıştırılır.
- Dosyam yükleniyor mu?
- Hayır. Modeller ve tüm işleme cihazınızda tarayıcınız içinde çalışıyor. Bunu kendiniz doğrulayabilirsiniz: tarayıcınızın DevTools açın, Ağ sekmesini izleyin ve dosyayı işleyin: yükleme yok. İlk ziyaretten sonra çoğu araç tamamen çevrimdışı çalışıyor.
- Hangi diller destekleniyor?
- Latince, Kiril, Arapça, Devanagari, CJK, Yunanca, Tayca, Tamil ve Telugu alfabelerinde 106 dil. Bengalce büyük bir boşluk, çünkü henüz bunun için bir v5 modeli yok ve seçici bunu tahmin etmek yerine söylüyor.
- Ne kadar doğru?
- Temiz belge metininde ölçülen karakter hata oranı %2'nin altındadır ve her satır bir güven puanı taşır, böylece hangilerini kontrol edeceğinizi görebiliyorsunuz. El yazısı ve düşük çözünürlüklü fotoğraflar daha kötü okunur.
- Taranmış PDF'leri okuyor mu?
- Evet. Dijital PDF'ler, kendi metin katmanlarından okunur ve karakterler tam konumlarda yer alır. Taranan sayfalar tespit ve tanıma sürecinden geçerken, karışık belgeler her ikisini de kullanır.