Skip to content

Praktische gids voor het eenvoudig downloaden en installeren van Tesseract OCR op uw computer

Tesseract OCR is een open source optische tekenherkenningsengine, onderhouden onder de Apache-licentie. Het transformeert de inhoud van een afbeelding of een…

Homme installant Tesseract OCR sur son ordinateur portable dans un bureau à domicile

Tesseract OCR is een open source optische tekenherkenningsmotor, onderhouden onder de Apache-licentie. Het transformeert de inhoud van een afbeelding of scan naar bruikbare tekst. Voordat je het in een Python-script of via de opdrachtregel gebruikt, moet je het eerst correct op je machine installeren, en daar beginnen vaak de problemen.

Variabele PATH en opdrachtfout: de valstrik die de meeste installaties blokkeert

Je hebt de installer gestart, meerdere keren op “Volgende” geklikt en vervolgens tesseract in je terminal getypt. Resultaat: “is niet erkend als een interne of externe opdracht”. Dit bericht is het meest voorkomende probleem na een handmatige installatie van Tesseract onder Windows.

De oorzaak is eenvoudig. De klassieke grafische installer (deze aangeboden door UB Mannheim) wijzigt niet altijd de omgevingsvariabele PATH van je systeem. PATH is de lijst van mappen waarin Windows zoekt naar programma’s wanneer je hun naam in een terminal typt.

Als de installatiemap van Tesseract (standaard C:Program FilesTesseract-OCR) daar niet in staat, weet je systeem simpelweg niet waar het de uitvoerbare bestanden kan vinden. Er zijn twee manieren om deze valstrik te vermijden, en de eerste is het vermelden waard omdat deze het probleem oplost voordat het zich zelfs maar voordoet.

Pakketbeheerders zoals winget of Chocolatey maken het mogelijk om Tesseract OCR te downloaden en te installeren met één enkele opdracht, met automatische configuratie van het PATH. Bijvoorbeeld, winget install -e --id UB-Mannheim.TesseractOCR of choco install tesseract installeren de motor en voegen het systeempad toe zonder handmatige tussenkomst.

Ontwikkelaar configureert Tesseract OCR via de opdrachtregel op een moderne werkplek

Tesseract OCR installeren onder Windows zonder pakketbeheerder

Als je de grafische installatie verkiest, ga dan naar de GitHub-repo van UB Mannheim om de .exe-installer te downloaden (beschikbaar in 64 en 32 bits). Het proces lijkt op dat van elke andere Windows-software: accepteer de licentie, kies de doelmap, selecteer de componenten.

Voeg het pad handmatig toe aan PATH

Na de installatie, open de systeeminstellingen (typ “omgevingsvariabelen” in de Windows zoekbalk). In de sectie “Systeemvariabelen”, selecteer de variabele Path, klik vervolgens op “Bewerken” en voeg het pad van de Tesseract-map toe.

Controleer de installatie door een nieuwe terminal te openen (niet degene die al open was voor de wijziging). Typ tesseract --version. Als het versienummer verschijnt, werkt alles.

Kies de taalpakketten tijdens de installatie

Standaard is alleen het Engelse pakket inbegrepen. Om tekst in het Frans te herkennen, vink de bijbehorende component aan in de installer, of voeg deze later toe door het bestand fra.traineddata te downloaden in de tessdata map van je installatie.

Tesseract OCR op macOS en Linux: installatiecommando’s

De installatie op macOS en Linux verloopt rechtstreeks via de native pakketbeheerders, wat de procedure aanzienlijk vereenvoudigt.

  • Op macOS, beheert Homebrew de volledige installatie: het commando brew install tesseract download de motor en de afhankelijkheden, en maakt de opdracht toegankelijk in de terminal zonder extra configuratie.
  • Op Ubuntu en Debian, sudo apt install tesseract-ocr installeert de motor. Om Frans toe te voegen, hoef je alleen het pakket tesseract-ocr-fra apart te installeren.
  • Op andere Linux-distributies variëren de commando’s (yum, dnf, pacman), maar het principe blijft hetzelfde: één pakket voor de motor, één pakket per taal.

In beide gevallen wordt het PATH automatisch geconfigureerd door de pakketbeheerder. Geen handmatige handelingen nodig.

IT-technicus download Tesseract OCR op een desktopcomputer in een professionele omgeving

Compatibiliteit van tessdata-bestanden met Tesseract 5.x

Dit is een punt dat weinig gidsen behandelen, en dat stille fouten kan veroorzaken. Tesseract 5.x gebruikt een herkenningsmotor gebaseerd op LSTM-netwerken. De trainingsgegevensbestanden (de .traineddata bestanden) bestaan in verschillende varianten, en niet allemaal werken ze met alle versies van de motor.

Drie officiële GitHub-repo’s bieden tessdata-bestanden aan:

  • tessdata: gecombineerde bestanden, compatibel met de LSTM-modus en de legacy-modus (oudere). Dit zijn de meest veelzijdige.
  • tessdata_best: de meest nauwkeurige LSTM-modellen, maar langzamer. Geschikt wanneer de kwaliteit van de herkenning belangrijker is dan de snelheid.
  • tessdata_fast: LSTM-modellen geoptimaliseerd voor snelheid, met een lichte verlies van nauwkeurigheid.

Als je Tesseract 5.x gebruikt en een .traineddata bestand downloadt vanuit de verkeerde repo, kan de motor verlaagde resultaten opleveren of weigeren te functioneren in legacy-modus. Controleer de herkomst van een bestand voordat je het in je tessdata map kopieert.

Eerste OCR-test via de opdrachtregel

Zodra Tesseract is geïnstalleerd en het PATH is geconfigureerd, voer een snelle test uit om te bevestigen dat alles werkt. Bereid een afbeelding voor met leesbare tekst (een scan van een document of een screenshot is geschikt).

Typ in je terminal: tesseract image.png output -l fra. Dit commando leest het bestand image.png, past het Franse taalpakket toe en schrijft het resultaat naar output.txt.

De kwaliteit van de invoerafbeelding bepaalt de nauwkeurigheid van het resultaat. Een scan met lage resolutie, schuin tekst of een zeer contrasterende achtergrond verminderen de betrouwbaarheid van de herkenning. Tesseract werkt het beste met scherpe afbeeldingen, met horizontale tekst en een duidelijk contrast tussen letters en achtergrond.

Voor meer geavanceerde projecten (integratie in Python-code, batchverwerking, paginasegmentatie), kan Tesseract ook als bibliotheek worden gebruikt via wrappers zoals pytesseract. De installatie van de motor blijft een vereiste, ongeacht het beoogde gebruik daarna.

Houd je versie van Tesseract en je tessdata-bestanden gesynchroniseerd: het is de combinatie van deze twee elementen die zorgt voor betrouwbare herkenning op de lange termijn.

Praktische gids voor het eenvoudig downloaden en installeren van Tesseract OCR op uw computer