एक फोटो, स्कैन या स्क्रीनशॉट से स्पेनिश पढ़ें, उच्चारण वाले स्वरों के साथ, ñ और उल्टे ¿ ¡ को गिराए जाने के बजाय सामान्य वर्णों के रूप में संभाला जाता है। एक 8 एमबी मॉडल में 47 लैटिन-लिपि भाषाएं शामिल हैं - फ्रेंच, जर्मन, पुर्तगाली, इतालवी, डच, पोलिश, तुर्की, वियतनामी और बहुत कुछ - इसलिए एक दस्तावेज़ जो उनके बीच स्विच करता है वह अभी भी एक पास है।
यह कैसे काम करता है
- कोई इमेज या PDFछोड़ें. टेक्स्ट डिटेक्शन तुरंत चलता है।
- अपना भाषा पैक चुनें (एक बार डाउनलोड किया गया, 8-17 एमबी) और पाठ पढ़ें दबाएं.
- पंक्तियों को कॉपी करें, या .txt/.json डाउनलोड करें। पीडीएफ को कवर करने के लिए कवर पढ़ा जाता है।
अक्सर पूछे जाने वाले प्रश्न
- क्या यह फ्रेंच या जर्मन OCRके समान मॉडल है?
- हाँ। पैडलओसीआर प्रति स्क्रिप्ट एक पहचानकर्ता को प्रशिक्षित करता है, प्रति भाषा नहीं, और सभी 47 लैटिन-लिपि भाषाएं इस 8 एमबी पैक को साझा करती हैं। यही कारण है कि इसके लिए 47 निकट-समान लोगों के बजाय एक पृष्ठ है - आप उनमें से किसी के लिए पहले से ही सही पृष्ठ पर हैं।
- क्या मेरी फ़ाइल अपलोड हो जाती है?
- नहीं। मॉडल और सभी प्रसंस्करण आपके अपने डिवाइस पर आपके ब्राउज़र के अंदर चलते हैं। आप इसे स्वयं सत्यापित कर सकते हैं: अपने ब्राउज़र का DevToolsखोलें, नेटवर्क टैब देखें, और एक फ़ाइल संसाधित करें: कोई अपलोड नहीं हैं। पहली विज़िट के बाद अधिकांश टूल पूरी तरह से ऑफ़लाइन भी काम करते हैं।
- कौन सी भाषाएँ समर्थित हैं?
- लैटिन, सिरिलिक, अरबी, देवनागरी, CJK, ग्रीक, थाई, तमिल और तेलुगु लिपियों में 106 भाषाएं। बंगाली एक बड़ा अंतर है, क्योंकि इसके लिए अभी तक कोई v5 मॉडल मौजूद नहीं है, और बीनने वाला अनुमान लगाने के बजाय ऐसा कहता है।
- यह कितना सटीक है?
- स्वच्छ दस्तावेज़ पाठ पर, मापी गई वर्ण त्रुटि दर 2% से कम है, और प्रत्येक पंक्ति में एक आत्मविश्वास स्कोर होता है ताकि आप देख सकें कि किसे जांचना है। लिखावट और कम-रिज़ॉल्यूशन वाली तस्वीरें बदतर पढ़ेंगी।
- क्या यह स्कैन की गई पीडीएफ पढ़ता है?
- हाँ। डिजिटल PDF को उनकी अपनी टेक्स्ट लेयर से पढ़ा जाता है, जिसमें सटीक स्थान पर सटीक वर्ण होते हैं। स्कैन किए गए पृष्ठ पहचान और पहचान से गुजरते हैं, और मिश्रित दस्तावेज़ दोनों का उपयोग करते हैं।