画像からタミル文字を読み取る。タミル語では母音を子音の周囲に付けたマークとして書きます(前後、上、または両側に同時に)ため、認識者はクラスターを左から右ではなく一つの単位として読み取らなければなりません。同じページの英語は同じ7.9MBパックで読み込まれ、一度ダウンロードするとオフラインで動作します。
使い方
- 画像や PDFを投稿してください。テキスト検出は即座に作動します。
- 言語パック(ダウンロード1回、8〜17MB)を選んで「テキストを読む」ボタンを押します。
- セリフをコピーするか、.txt/.jsonをダウンロードしてください。PDFは最初から最後まで読み進めます。
よくある質問
- どのタミル語の資料が最も読みやすいですか?
- 印刷されたテキスト――本、標識、フォーム、スクリーンショット――が訓練対象であり、最も強みを発揮する場所です。手書きのタミル語はその訓練には含まれていません。すべての行には自信スコアがついているため、弱い読み方は無言ではなく目に見えます。
- 私のファイルはアップロードされますか?
- いいえ。モデルやすべての処理は、自分のデバイス上のブラウザ内で動作します。ご自身で確認できます:ブラウザの DevToolsを開き、ネットワークタブを見てファイルを処理すると、アップロードはありません。初回訪問後はほとんどのツールも完全にオフラインで動作します。
- どの言語が対応していますか?
- ラテン文字、キリル文字、アラビア文字、デーヴァナーガリー文字、 CJK文字、ギリシャ文字、タイ文字、タミル文字、テルグ文字で106言語が書かれています。ベンガル語が唯一の大きなギャップで、まだv5モデルが存在せず、選ぶ人が推測ではなくそう言っています。
- その精度はどのくらいですか?
- クリーンな文書テキストでは、測定された文字誤り率は2%未満で、各行に信頼度スコアが付いているので、どの行をチェックすべきかがわかります。手書きや低解像度の写真は読みにくいです。
- スキャンされたPDFは読み取れますか?
- はい。デジタルPDFは独自のテキストレイヤーから読み上げられ、正確な文字が正確な位置に記載されています。スキャンされたページは検出と認識を経て、混合文書は両方を使用します。