Przeczytaj hiszpański ze zdjęcia, skanu lub zrzutu ekranu, z akcentowanymi samogłoskami, ñ i odwróconymi – ¡ traktowane jak zwykłe znaki, a nie pominięte. Jeden model 8 MB obejmuje 47 języków alfabetu łacińskiego — francuski, niemiecki, portugalski, włoski, niderlandzki, polski, turecki, wietnamski i inne — więc dokument przełączający się między nimi to wciąż jednorazowe przejście.
Jak to działa
- Wrzuć zdjęcie lub PDF. Wykrywanie tekstu uruchamia się natychmiast.
- Wybierz swój pakiet językowy (pobrany raz, 8–17 MB) i naciśnij Czytaj tekst.
- Skopiuj kwestie lub pobierz .txt / .json. PDF-y czyta się od deski do deski.
Najczęstsze pytania
- Czy to ten sam model co francuski czy niemiecki OCR?
- Tak. PaddleOCR trenuje jeden rozpoznawacz na każdy SCRIPT, a nie na język, a wszystkie 47 języków alfabetu łacińskiego korzysta z tego pakietu 8 MB. Dlatego jest jedna strona na nią, a nie 47 niemal identycznych — jesteś już na właściwej stronie dla każdej z nich.
- Czy mój plik jest przesyłany?
- Nie. Modele i całe przetwarzanie działają w Twojej przeglądarce na twoim urządzeniu. Możesz to sprawdzić sam: otwórz DevTools przeglądarki, obejrzyj zakładkę Sieć i przetworz plik: nie ma żadnych przesłań. Po pierwszej wizycie większość narzędzi działa całkowicie offline.
- Które języki są obsługiwane?
- 106 języków w alfabecie łaciny, cyrylicy, arabskim, dewanagari, CJK, greckim, tajskim, tamilskim i telugu. Bengalski to jedyna główna luka, bo nie istnieje jeszcze model v5 dla niej, a wybierający mówi to zamiast zgadywać.
- Jak bardzo jest dokładny?
- W czystym tekście dokumentu wskaźnik błędów znaków wynosi poniżej 2%, a każda linijka ma ocenę pewności, więc możesz zobaczyć, które należy sprawdzić. Pismo ręczne i zdjęcia w niskiej rozdzielczości będą wyglądać gorzej.
- Czy czyta zeskanowane PDF-y?
- Tak. Cyfrowe pliki PDF są odczytywane z własnej warstwy tekstowej, z dokładnymi znakami na dokładnych pozycjach. Zeskanowane strony przechodzą przez wykrywanie i rozpoznawanie, a dokumenty mieszane korzystają z obu tych metod.