Pular para o conteúdo
FoiFácil

Como extrair texto de uma imagem: guia prático de OCR

Atualizado em 2026-08-25

O que é OCR

OCR é a sigla de Optical Character Recognition — reconhecimento óptico de caracteres. É a tecnologia que olha para a imagem de um texto e devolve o texto de verdade, aquele que dá para copiar, editar e pesquisar.

O problema que ele resolve é antigo e continua comum: você recebe um documento escaneado, um print de conversa ou a foto de uma página, e precisa do conteúdo em texto. A alternativa é redigitar tudo.

Como funciona, em linhas gerais

O processo tem etapas bem definidas. Primeiro o sistema tenta corrigir a imagem: endireitar a página, ajustar contraste, separar o texto do fundo. Depois localiza as regiões de texto e as divide em linhas e palavras. Só então reconhece cada caractere, comparando formas com o que aprendeu.

A última etapa é a que mais surpreende: o reconhecedor usa contexto de idioma para corrigir a si mesmo. Se ele hesita entre "c" e "e" numa palavra, o dicionário do idioma ajuda a decidir. É por isso que escolher o idioma certo muda tanto o resultado — principalmente em português, onde acento e cedilha dependem desse contexto.

O que mais afeta a precisão

Em ordem de impacto real:

Foco e resolução. Texto desfocado é irrecuperável. Nenhum algoritmo reconstrói informação que não foi capturada. Aproxime a câmera até o texto preencher o quadro, em vez de fotografar de longe e cortar depois.

Inclinação. Página torta é a segunda maior causa de erro. O reconhecedor espera linhas horizontais; quanto mais inclinado, mais ele erra. Fotografe de frente, com a câmera paralela ao papel.

Iluminação. Sombra da própria mão ou do celular sobre a página derruba o contraste local. Luz difusa e uniforme funciona melhor que flash direto, que cria reflexo em papel brilhante.

Tipo de fonte. Texto impresso em fonte comum é reconhecido muito bem. Fonte decorativa, texto muito condensado e letra manuscrita cursiva têm taxa de erro alta — no caso do manuscrito cursivo, alta o suficiente para inviabilizar o uso.

Fundo. Papel liso e claro é o ideal. Papel timbrado com marca d'água, papel amassado ou fundo colorido atrapalham.

Como fotografar para acertar de primeira

Um método que funciona quase sempre:

  1. Coloque o documento numa superfície plana, sem dobras
  2. Posicione uma luz difusa lateral, ou use luz de janela sem sol direto
  3. Segure o celular paralelo ao papel, não inclinado
  4. Aproxime até o texto preencher a tela
  5. Toque na tela para focar no texto antes de disparar
  6. Confira a foto ampliada antes de usar: se você não consegue ler confortavelmente, o OCR também não vai

Usando a ferramenta

Com a imagem pronta, o processo é direto:

  1. Abra o conversor de imagem em texto
  2. Envie a foto ou print
  3. Escolha o idioma predominante — esse passo é o mais negligenciado e o que mais melhora acentuação
  4. Clique em extrair e aguarde
  5. Copie o texto ou baixe como .txt

Na primeira execução, os dados do idioma são baixados e ficam em cache. Da segunda vez em diante é bem mais rápido.

Sempre revise o resultado

Mesmo com imagem boa, o OCR troca caracteres visualmente parecidos. Os pares clássicos:

Confusão comum Onde costuma aparecer
0 e O Códigos, placas, CPF
1, l e I Números de documento
rn e m Texto corrido
5 e S Valores e códigos
8 e B Números de série

Em texto corrido, um erro ocasional é fácil de notar e corrigir. Em número de documento, valor monetário e código, o erro passa despercebido e causa problema real — confira sempre esses campos manualmente.

Depois de extrair, o contador de palavras ajuda a conferir se o volume bate com o esperado: uma diferença grande costuma indicar que um trecho não foi reconhecido.

Limitações que valem conhecer

Tabelas perdem o alinhamento. O texto é extraído, mas a estrutura de colunas não é preservada. Tabelas saem como linhas soltas e precisam ser reorganizadas.

Texto em colunas pode embaralhar. Jornal e revista com múltiplas colunas às vezes têm a ordem de leitura invertida, porque a sequência fica ambígua.

Manuscrito cursivo não funciona. Esse tipo de OCR é treinado em texto impresso.

PDF precisa virar imagem antes. A ferramenta trabalha com imagens: exporte a página do PDF como imagem ou tire um print.

A questão da privacidade

Documento escaneado costuma conter exatamente o tipo de informação que você não quer distribuir: CPF, endereço, valores, assinatura. A maioria dos serviços de OCR online envia o arquivo para um servidor.

O reconhecimento deste site roda inteiramente no seu navegador — o arquivo não é enviado a lugar nenhum. É o que torna aceitável usar em contrato, holerite ou documento pessoal.

Ferramentas relacionadas