TesseractOCR

Informações

Este extra utiliza o motor de OCR Tesseract, de código aberto e gratuito, para executar o reconhecimento óptico de caracteres a um documento de imagem, seja PDF, JPG, TIF ou outro, sem necessidade de abrir o documento. O resultado é mostrado num documento de texto com o mesmo nome do original, mas com extensão .txt colocado na mesma pasta. Também permite o acesso a scanners compatíveis WIA para efectuar OCR a um documento em papel. Neste caso, o documento com o resultado é colocado na pasta Documentos do usuário com o nome ocr.txt.

Por último, pode obter o texto de um PDF acessível e mostrá-lo no Bloco de notas. No menu do NVDA, Preferências é adicionada uma secção TesseractOCR, onde poderá configurar os idiomas a utilizar no reconhecimento e o tipo de documentos a reconhecer. Neste diálogo, para poder fazer OCR a arquivos PDF protegidos por senha, pode marcar para ser solicitada uma senha. Se esta opção estiver marcada, e o PDF não necessitar de senha, basta pressionar Enter na caixa de diálogo a pedir a senha. À excepção dos idiomas português e inglês, que já são incluidos no extra, os restantes idiomas serão descarregados e instalados quando for seleccionado um idioma que ainda não exista no extra. Note que à medida que aumenta o número de idiomas de reconhecimento seleccionados, o processo de OCR será mais longo. Por isso, recomendamos a utilização apenas dos idiomas necessários. Note também que a qualidade do reconhecimento pode variar de acordo com a ordem dos idiomas. Portanto, se o resultado do reconhecimento não for satisfatório, pode tentar outra ordenação dos idiomas.

Comandos

Os comandos predefinidos são:

Windows+Control+w - Para digitalizar e reconhecer um documento através do scanner; Windows+Control+r - Para reconhecer o ficheiro seleccionado; Windows+Control+t - Para obter o texto de um PDF acessível. Windows+Control+c - Para cancelar o processo de digitalização. Nota: Tem de ser executado antes de aparecer a caixa de diálogo que pergunta se pretende digitalizar mais páginas!

Depois é só esperar que se abra o ficheiro ocr.txt.

Problemas conhecidos

Idiomas suportados

Os idiomas suportados nesta versão são:

Tipos de imagens suportados

Este extra suporta os seguintes tipos de ficheiros: