TesseractOCR

Tiedot

Tämä lisäosa käyttää ilmaista ja avoimen lähdekoodin Tesseract OCR -moottoria tekstintunnistuksen suorittamiseen kuvatiedostolle (kuten PDF, JPG tai TIF) tarvitsematta avata sitä. Tunnistuksen tuloksen sisältävä tekstitiedosto tallennetaan samaan kansioon alkuperäisen tiedoston kanssa samalla nimellä, mutta .txt-tunnisteella. Lisäosalla voidaan myös suorittaa tekstintunnistus paperiasiakirjoille WIA-yhteensopivien skannereiden avulla. Tulokset näytetään käyttäjän Tiedostot-kansioon tallennettavassa OCR.txt-tiedostossa. Lisäosa pystyy myös poimimaan tekstin saavutettavista PDF-tiedostoista XPDF-työkalujen avulla. NVDA:n asetusvalintaikkunaan on lisätty TesseractOCR-kategoria, jossa voit muuttaa seuraavia asetuksia:

Lisäosaan sisältyviä englantia ja portugalia lukuun ottamatta tunnistuskielet ladataan ja asennetaan niitä valittaessa. Huom: Tekstintunnistus kestää sitä kauemmin, mitä enemmän tunnistuskieliä on valittuna. Tämän vuoksi suosittelemme, että käytät vain tarvitsemiasi kieliä. Huomaa myös, että tunnistuksen laatu saattaa vaihdella sen mukaan, missä järjestyksessä kielet ovat. Tästä syystä kannattaa kokeilla järjestää kielet eri tavalla, jos tunnistuksen tulos ei ole tyydyttävä.

Pikanäppäimet

Oletuskomennot ovat: Win+Ctrl+W: Skannaa skannerissa olevan asiakirjan ja suorittaa sille tekstintunnistuksen Win+Ctrl+R: Suorittaa tekstintunnistuksen valitulle asiakirjalle Win+Ctrl+T: Poimii tekstin saavutettavasta PDF-tiedostosta Win+Ctrl+C: Peruuttaa skannauksen Huom: Komentoa on käytettävä ennen lisäsivujen skannausta kysyvän valintaikkunan ilmestymistä.

Tunnistetun tekstin sisältävä tekstitiedosto avautuu jonkin ajan kuluttua.

Näitä komentoja on mahdollista muuttaa Näppäinkomennot-valintaikkunan TesseractOCR-osiossa.

Tunnetut ongelmat

Tuetut kielet

Tämä versio tukee seuraavia kieliä:

Tuetut kuvamuodot

Tämä lisäosa tukee seuraavia tiedostotyyppejä: