O que é e para que serve
OCR (reconhecimento óptico de caracteres) é a tecnologia que transforma a foto de um texto em texto de verdade, que dá para copiar, colar, editar e pesquisar. É o que resolve aquele problema comum de receber um documento escaneado, um print de conversa ou a foto de uma página de livro e precisar do conteúdo escrito, sem redigitar tudo na mão.
Esta ferramenta faz o reconhecimento dentro do seu navegador, com suporte a português, inglês e espanhol. Como nada é enviado para servidor, dá para usar até em documentos com informação sensível — contrato, holerite, comprovante — sem entregar o arquivo para terceiros.
Como usar
- Envie a imagem (foto, print de tela ou página escaneada).
- Escolha o idioma predominante do texto. Acertar o idioma melhora bastante a precisão, principalmente com acentos.
- Clique em "Extrair texto" e aguarde. Na primeira vez, os dados do idioma escolhido são baixados e ficam em cache.
- Copie o texto reconhecido ou baixe como arquivo .txt.
Exemplos práticos
Documento escaneado. Um contrato em papel fotografado de frente, com boa luz, costuma sair com precisão alta. Ainda vale reler números e nomes próprios.
Print de conversa. Extrair o texto de um print de WhatsApp para colar num e-mail ou relatório evita redigitar.
Página de livro. Fotografe a página aberta, o mais reta possível. Livro com página curva no meio gera erro na região da lombada.
Slide de aula. Foto do projetor costuma ter distorção e reflexo. Se puder, use o PDF original; se não, fotografe o mais perpendicular possível.
Nota fiscal ou recibo. Papel térmico desbota e tem fonte pequena — é dos casos mais difíceis. Aproxime bem a câmera e use luz difusa.
Placa ou cartaz. Texto grande e contrastado é o cenário ideal, e costuma sair quase perfeito.
O que mais afeta a precisão
| Fator | Impacto |
|---|---|
| Foco e resolução | Altíssimo |
| Inclinação da página | Alto |
| Sombra sobre o papel | Alto |
| Idioma correto selecionado | Médio (acentos) |
| Fonte manuscrita | Inviável |
Detalhes e limitações
A qualidade do OCR depende muito mais da imagem do que da ferramenta. O que mais atrapalha o reconhecimento, em ordem de impacto:
- Foco e resolução: texto desfocado ou pequeno demais é a principal causa de erro. Aproxime a câmera em vez de fotografar de longe e depois cortar.
- Inclinação: página torta confunde o reconhecedor. Fotografe o mais reto possível, de frente.
- Iluminação e sombra: sombra da própria mão ou do celular sobre o papel derruba o contraste. Luz difusa e uniforme funciona melhor que flash direto.
- Fonte: texto impresso é reconhecido bem; letra cursiva manuscrita é praticamente impossível para esse tipo de OCR.
Depois de extrair, sempre vale reler o resultado: mesmo em condições boas, o OCR costuma confundir caracteres parecidos, como 0 e O, 1 e l, rn e m. Números de documento, valores e códigos merecem conferência manual.
O reconhecimento roda inteiro no navegador, então imagens muito grandes ou dispositivos mais fracos levam mais tempo.
Erros comuns
Fotografar de longe e cortar depois. Isso reduz a resolução real do texto. Aproxime a câmera até o texto preencher o quadro.
Escolher o idioma errado. Selecionar inglês num texto em português faz o reconhecedor errar acentos e til sistematicamente. O idioma orienta o modelo sobre quais combinações de letras são prováveis.
Fotografar em ângulo. Página torta é a segunda maior causa de erro. Posicione a câmera paralela ao papel, não de lado.
Usar flash direto. O reflexo apaga trechos inteiros em papel brilhante. Luz ambiente difusa funciona muito melhor.
Confiar sem revisar. Mesmo com boa imagem, o OCR troca caracteres parecidos: 0 e O, 1 e l, rn e m. Em CPF, valor e código, sempre confira manualmente.
Esperar que reconheça letra de mão. Esse tipo de OCR é treinado em texto impresso. Manuscrito cursivo tem taxa de erro que inviabiliza o uso.
Enviar imagem com várias colunas. Jornal e revista em colunas podem sair com as linhas embaralhadas, porque a ordem de leitura fica ambígua.
Perguntas frequentes
O OCR reconhece letra de mão?
Não de forma confiável. Essa ferramenta é feita para texto impresso ou digitado. Letra cursiva manuscrita tem taxa de erro alta demais para ser útil.
Meu documento é enviado para algum servidor?
Não. O reconhecimento acontece inteiramente no seu navegador, o que torna a ferramenta segura inclusive para documentos com dados sensíveis.
Como melhorar o resultado de uma foto ruim?
Refaça a foto de frente, bem próxima do texto, com luz uniforme e sem sombra sobre a página. Isso resolve a maioria dos casos de reconhecimento falho.
Dá para extrair texto de um PDF?
Esta ferramenta trabalha com imagens. Para um PDF, tire um print da página ou exporte a página como imagem e envie o arquivo resultante.
O OCR reconhece PDF?
Esta ferramenta trabalha com imagens. Para um PDF, exporte a página como imagem ou tire um print e envie o arquivo resultante.
Por que os acentos saem errados?
Quase sempre é o idioma errado selecionado. Escolher português orienta o reconhecedor sobre quais combinações são prováveis, o que melhora bastante acentos e cedilha.
Consigo extrair texto de uma tabela mantendo o formato?
O texto é extraído, mas o alinhamento em colunas não é preservado. Tabelas saem como linhas de texto e precisam ser reorganizadas manualmente.
Existe limite de tamanho da imagem?
Não há limite fixo, mas imagens muito grandes demoram mais, já que o reconhecimento roda no seu aparelho. Um bom equilíbrio é ter o texto nítido sem exagerar na resolução.