Цей додаток використовує безкоштовну систему Tesseract OCR з відкритим джерельним кодом для оптичного розпізнавання символів у файлі зображення, PDF, JPG, TIF чи іншому, без потреби його відкривати. Текстовий файл буде розміщено в тій самій папці з тим самим іменем, що й оригінальний файл, але з розширенням .TXT. Він також використовує wia-cmd-сканер, щоб отримати доступ до сканерів із підтримкою WIA та виконати оптичне розпізнавання для паперового документа. Результат показується у файлі з назвою OCR.txt, який розміщено в папці «Документи» облікового запису користувача. Нарешті, він також може видобувати доступний текст з доступних PDF-файлів, використовуючи XPDF tools. В налаштуваннях NVDA буде створено категорію TesseractOCR, де можна налаштувати такі параметри: - мови, які будуть використовуватися при розпізнаванні; - типи документів, що розпізнаються; - запитувати чи не запитувати пароль до PDF-файлу. Якщо ви позначили цей параметр, а PDF-файл не має пароля, просто натисніть Enter у діалозі з запитом пароля; - встановити роздільну здатність сканера в діапазоні від 150 до 400 dpi; - параметр для виявлення орієнтації паперу; - параметр, який дозволяє вказати, використовувати чи ні звукові сигнали для сигналізування про перебіг процесу.
За винятком англійської й португальської мов, які вже включені в додаток, інші мови буде завантажено та встановлено, коли ви виберете мову, якої ще немає в додатку. Зауважте, що зі збільшенням кількості вибраних мов, процес розпізнавання триватиме довше. Тому ми рекомендуємо використовувати лише ті мови, які вам потрібні. Зауважте також, що якість розпізнавання може відрізнятися залежно від порядку мов. Тому, якщо результат розпізнавання незадовільний, ви можете спробувати інший порядок мов.
Початково використовуються такі команди: Windows+Control+w — для сканування та розпізнавання документа через сканер; Windows+Control+r — для розпізнавання вибраного документа; Windows+Control+t — для отримання тексту з доступних PDF-файлів; Windows+Control+c — для скасування процесу сканування. Зверніть увагу: комбінація повинна бути застосована до того, як з'явиться діалог із запитом про те, чи хочете ви відсканувати більше сторінок!
Потім просто зачекайте, поки відкриється текстовий файл із розпізнаним текстом.
Ці команди можна змінити в діалозі «Жести вводу» в розділі «TesseractOCR».
У цій версії підтримуються такі мови: * Африканська * Албанська * Амхарська * Арабська * Вірменська * Ассамська * Азербайджанська (латиниця) * Баскська * Білоруська * Бенгальська * Боснійська * Бретонська * Болгарська * Бірманська * Каталонська/Валенсія * Себуанська * Черокі * Китайська спрощена * Китайська традиційна * Корсиканська * Хорватська * Чеська * Данська * Німецька * Мальдівська * Голланська (фламандська) * Дзонг-ке * Англійська * Есперанто * Естонська * Фарерська * Філіппінська * Фінська * Французька * Галісійська * Грузинська * Грецька * Гуджараті * Гаїтянська * Іврит * Гінді * Угорська * Ісландська * Індонезійська * Інуктитут * Ірландська * Італійська * Яванська * Японська * Каннада * Казахська * Кхмерська (Central) * Киргизька * Корейська * Курдська Kurmanji * Лаоська * Латинська * Латиська * Литовська * Люксембурзька * Македонська * Малайська * Малаялам * Мальтійська * Маорійська * Маратська * Модуль виявлення математики / рівнянь * Монгольська * Непальська * Норвезька * Окситанська * Орія * Пенджабська * Пушту * Перська * Польська * Португальська * Кечуа * Румунська / Молдавська * Російська * Санскрит * Шотландська гельська * Сербська (латиниця) * Словацька * Словенська * Синдхі * Сингальська * Іспанська * Сунданська * Суахілі * Шведська * Сирійська * Таджицька * Тамільська * Татарська * Телугу * Тайська * Тибетська * Тигринья * Тонганська * Турецька * Уйгурська * Українська * Урду * Узбецька (латиниця) * В'єтнамська * Валлійська * Західнофризька * Їдиш * Йоруба
Цей додаток підтримує такі типи файлів: * PDF * jpg * tif * png * bmp * pnm * pbm * pgm * jp2 * gif * jfif * jpeg * tiff * spix * webp