Skip to content

Guia prático para baixar e instalar o Tesseract OCR facilmente no seu computador

Tesseract OCR é um motor de reconhecimento óptico de caracteres de código aberto, mantido sob licença Apache. Ele transforma o conteúdo de uma imagem ou de um…

Homme installant Tesseract OCR sur son ordinateur portable dans un bureau à domicile

Tesseract OCR é um motor de reconhecimento óptico de caracteres open source, mantido sob licença Apache. Ele transforma o conteúdo de uma imagem ou de um scan em texto utilizável. Antes de usá-lo em um script Python ou na linha de comando, é necessário instalá-lo corretamente em sua máquina, e é frequentemente aí que os problemas começam.

Variável PATH e erro de comando: a armadilha que bloqueia a maioria das instalações

Você lançou o instalador, clicou em “Avançar” várias vezes, e então digitou tesseract no seu terminal. Resultado: “não é reconhecido como um comando interno ou externo”. Essa mensagem é o problema mais comum após uma instalação manual do Tesseract no Windows.

A causa é simples. O instalador gráfico clássico (aquele oferecido pela UB Mannheim) nem sempre modifica a variável de ambiente PATH do seu sistema. O PATH é a lista de pastas nas quais o Windows procura os programas quando você digita seus nomes em um terminal.

Se a pasta de instalação do Tesseract (por padrão C:Program FilesTesseract-OCR) não estiver lá, seu sistema simplesmente não sabe onde encontrar o executável. Existem duas maneiras de evitar essa armadilha, e a primeira merece ser conhecida, pois resolve o problema antes mesmo que ele apareça.

Gerenciadores de pacotes como winget ou Chocolatey permitem baixar e instalar o Tesseract OCR em um único comando, com configuração automática do PATH. Por exemplo, winget install -e --id UB-Mannheim.TesseractOCR ou choco install tesseract instalam o motor e adicionam o caminho do sistema sem intervenção manual.

Desenvolvedora configurando Tesseract OCR via linha de comando em um computador moderno

Instalar Tesseract OCR no Windows sem gerenciador de pacotes

Se você prefere a instalação gráfica, vá até o repositório GitHub da UB Mannheim para baixar o instalador .exe (disponível em 64 e 32 bits). O processo é semelhante ao de qualquer software do Windows: aceitar a licença, escolher a pasta de destino, selecionar os componentes.

Adicionar o caminho ao PATH manualmente

Após a instalação, abra as configurações do sistema (digite “variáveis de ambiente” na barra de pesquisa do Windows). Na seção “Variáveis do sistema”, selecione a variável Path, clique em “Editar” e adicione o caminho da pasta do Tesseract.

Verifique a instalação abrindo um novo terminal (não aquele que já estava aberto antes da modificação). Digite tesseract --version. Se o número da versão aparecer, tudo está funcionando.

Selecionar os pacotes de idiomas durante a instalação

Por padrão, apenas o pacote em inglês está incluído. Para reconhecer texto em francês, marque o componente correspondente no instalador, ou adicione-o posteriormente baixando o arquivo fra.traineddata na pasta tessdata da sua instalação.

Tesseract OCR no macOS e Linux: comandos de instalação

A instalação no macOS e Linux é feita diretamente pelos gerenciadores de pacotes nativos, o que simplifica consideravelmente o procedimento.

  • No macOS, Homebrew gerencia a instalação completa: o comando brew install tesseract baixa o motor e as dependências, tornando o comando acessível no terminal sem configuração adicional.
  • No Ubuntu e Debian, sudo apt install tesseract-ocr instala o motor. Para adicionar o francês, basta instalar o pacote tesseract-ocr-fra separadamente.
  • Em outras distribuições Linux, os comandos variam (yum, dnf, pacman), mas o princípio permanece o mesmo: um pacote para o motor, um pacote por idioma.

Em ambos os casos, o PATH é configurado automaticamente pelo gerenciador de pacotes. Não é necessária manipulação manual.

Técnico de TI baixando Tesseract OCR em um computador de mesa em ambiente profissional

Compatibilidade dos arquivos tessdata com Tesseract 5.x

Esse é um ponto que poucos guias abordam, e que provoca erros silenciosos. O Tesseract 5.x utiliza um motor de reconhecimento baseado em redes LSTM. Os arquivos de dados de treinamento (os arquivos .traineddata) existem em várias variantes, e nem todas funcionam com todas as versões do motor.

Três repositórios oficiais do GitHub oferecem arquivos tessdata:

  • tessdata: arquivos combinados, compatíveis com o modo LSTM e o modo legacy (mais antigos). Esses são os mais versáteis.
  • tessdata_best: modelos LSTM mais precisos, mas mais lentos. Adequados quando a qualidade do reconhecimento é mais importante que a velocidade.
  • tessdata_fast: modelos LSTM otimizados para rapidez, com uma leve perda de precisão.

Se você estiver usando o Tesseract 5.x e baixar um arquivo .traineddata do repositório errado, o motor pode produzir resultados degradados ou se recusar a funcionar no modo legacy. Antes de copiar um arquivo para sua pasta tessdata, verifique sua origem.

Primeiro teste OCR na linha de comando

Uma vez que o Tesseract esteja instalado e o PATH configurado, faça um teste rápido para confirmar que tudo está funcionando. Prepare uma imagem contendo texto legível (um scan de documento ou uma captura de tela servem).

Digite no seu terminal: tesseract image.png output -l fra. Este comando lê o arquivo image.png, aplica o pacote de idioma francês e escreve o resultado em output.txt.

A qualidade da imagem de entrada determina a precisão do resultado. Um scan em baixa resolução, um texto inclinado ou um fundo muito contrastante reduzem a confiabilidade do reconhecimento. O Tesseract funciona melhor em imagens nítidas, com texto horizontal e um contraste forte entre caracteres e fundo.

Para projetos mais avançados (integração em código Python, processamento em lote, segmentação de página), o Tesseract também pode ser usado como biblioteca através de wrappers como pytesseract. A instalação do motor continua sendo o pré-requisito, independentemente do uso pretendido depois.

Mantenha sua versão do Tesseract e seus arquivos tessdata sincronizados: é a combinação desses dois elementos que garante um reconhecimento confiável a longo prazo.

Guia prático para baixar e instalar o Tesseract OCR facilmente no seu computador