Extrair texto de uma imagem
Converta imagens JPG, PNG e WebP em texto editável em segundos.
Como extrair texto de uma imagem
- 01Escolha uma imagem JPG, PNG ou WebP do seu dispositivo.
- 02Selecione o idioma usado na imagem e gire a visualização se necessário.
- 03Extraia o texto, revise-o e copie-o ou baixe um arquivo TXT.
O que este OCR processa
A ferramenta reconhece texto impresso em inglês, vietnamita, alemão, holandês, chinês simplificado, japonês, coreano e árabe. Digitalizações nítidas e capturas de tela geralmente funcionam melhor do que fotos borradas ou distorcidas.
Limitações do OCR
A ordem de leitura pode ser imperfeita em páginas com várias colunas, tabelas, escrita à mão e texto muito curvo.
Perguntas sobre OCR de imagens
Qual qualidade de imagem produz melhores resultados de OCR?
Texto impresso nítido e de alto contraste funciona melhor. Use uma imagem nítida com pixels suficientes para caracteres pequenos, iluminação uniforme, compressão limitada e uma página fotografada o mais plana e reta possível. Corte fundos não relacionados e gire o texto para a posição vertical antes da extração. Resolução muito baixa, desfoque de movimento, reflexos, sombras, papel texturizado, páginas curvas, fontes decorativas e aprimoramento agressivo de imagem podem fundir ou quebrar as formas dos caracteres. Ampliar uma imagem genuinamente de baixa resolução pode ajudar na visibilidade, mas não pode recriar detalhes que nunca foram capturados.
Por que a escolha do idioma correto do OCR é importante?
A escolha do idioma determina qual modelo de reconhecimento e quais padrões de caracteres são esperados. Selecionar inglês para texto em chinês, japonês, coreano, árabe, vietnamita ou alemão pode gerar substituições plausíveis, porém incorretas, porque o alfabeto, os acentos, a direção e os padrões de palavras esperados são diferentes. Escolha o idioma dominante visível na imagem. Quando uma imagem mistura vários idiomas, extraia a seção mais importante separadamente com o idioma correspondente e compare nomes, números, datas e termos técnicos com atenção, pois eles recebem menos ajuda dos padrões de idioma comuns.
O que pode afetar a ordem de leitura detectada?
O OCR identifica regiões de texto e as ordena de acordo com suas posições. Artigos com várias colunas, tabelas, barras laterais, formulários, legendas, texto vertical, rótulos curvos, carimbos sobrepostos e anotações manuscritas podem tornar a sequência pretendida ambígua. Recorte regiões independentes e extraia-as separadamente quando a ordem for importante. Após a extração, compare o resultado com a imagem original de cima para baixo, restaure quebras de parágrafo e verifique títulos, linhas de tabela, rótulos, notas de rodapé e texto que fica ao lado de imagens, em vez de presumir que um layout completo do documento foi reconstruído.
O OCR pode preservar tabelas e formatação de documentos?
Não. Esta ferramenta retorna texto editável e regiões detectadas, não uma recriação em Word, planilha ou PDF pesquisável do design original. Colunas podem ser lidas em ordem inesperada, células de tabela podem perder as relações de linha e coluna, e fonte, cor, espaçamento, bordas, imagens e elementos de página não são preservados como um layout correspondente. Use o resultado para evitar redigitar e, depois, reconstrua a estrutura necessária no aplicativo de destino e compare valores importantes com a imagem original antes de confiar neles.
Por que o tempo de processamento do OCR pode variar?
O tempo depende das dimensões da imagem, do número e do tamanho das regiões de texto, da complexidade do layout, do idioma selecionado, da rotação e dos recursos necessários para preparar o reconhecimento. Uma foto grande com um documento pequeno no centro pode exigir mais trabalho e ainda assim produzir texto pior do que uma digitalização bem cortada. Use a menor imagem nítida que retenha os caracteres necessários, corte áreas irrelevantes e evite ampliar repetidamente imagens já nítidas. Mantenha a página aberta até que um resultado ou erro útil apareça.
Como devo verificar o texto extraído por OCR?
Compare nomes, datas, endereços, totais, separadores decimais, números de conta, identificadores, pontuação e qualquer caractere em que um único erro mude o significado. Confusões comuns incluem zero e O, um e l minúsculo, pontuação semelhante, letras acentuadas e caracteres visualmente relacionados em escrita CJK ou árabe. Revise a ordem das linhas e o texto ausente ao redor de imagens ou tabelas. Para material jurídico, financeiro, médico, acadêmico ou de arquivo, faça uma segunda revisão com a imagem original antes de copiar o resultado para outro registro.