TesseractOCR

Informações

Este extra utiliza o motor de OCR Tesseract, de código aberto e gratuito, para executar o reconhecimento óptico de caracteres a um documento de imagem, seja PDF, JPG, TIF ou outro, sem necessidade de abrir o documento. O resultado é mostrado num documento de texto com o mesmo nome do original, mas com extensão .txt colocado na mesma pasta. Também permite o acesso a scanners compatíveis WIA para efectuar OCR a um documento em papel. Neste caso, o documento com o resultado é colocado na pasta Documentos do utilizador com o nome ocr.txt. Por último, pode obter o texto de um PDF acessível e mostrá-lo no Bloco de notas. No menu NVDA, Preferências, é adicionada uma secção TesseractOCR, onde pode configurar o seguinte:

À excepção dos idiomas português e inglês, que já são incluidos no extra, os restantes idiomas serão descarregados e instalados quando for seleccionado um idioma que ainda não exista no extra. Note que à medida que aumenta o número de idiomas de reconhecimento seleccionados, o processo de OCR será mais longo. Por isso, recomendamos a utilização apenas dos idiomas necessários. Note também que a qualidade do reconhecimento pode variar de acordo com a ordem dos idiomas. Por conseguinte, se o resultado do reconhecimento não for satisfatório, pode tentar outra ordenação.

Comandos

Os comandos predefinidos são: Windows+Control+w - Para digitalizar e reconhecer um documento através do scanner; Windows+Control+r - Para reconhecer o ficheiro seleccionado; Windows+Control+t - Para obter o texto de um PDF acessível. Windows+Control+c - Para cancelar o processo de digitalização. Nota: Tem de ser executado antes de aparecer a caixa de diálogo que pergunta se pretende digitalizar mais páginas!

Depois é só esperar que o ficheiro ocr.txt apareça com o texto reconhecido.

Estes comandos podem ser modificados na caixa de diálogo "Definir comandos" na secção "TesseractOCR".

Problemas conhecidos

Idiomas suportados

Os idiomas suportados nesta versão são:

Tipos de imagem suportados

Este extra suporta os seguintes tipos de ficheiros: