PDF digitalizado para texto

Esta ferramenta converte PDFs digitalizados em texto editável para que você possa copiar, editar e adicionar conteúdo com facilidade.

Envie seu arquivo

ou solte, cole ou escolha da nuvem

Colar URL Testar exemplo
Google Drive Dropbox OneDrive
100% grátis Nenhuma instalação necessária Seguro e privado
Publicidade
Usado por
eBay Booking.com University of Michigan Cornell University Columbia University
Avalie esta ferramenta
0/5 · 0 votos

Quando um PDF digitalizado precisa de OCR e quando não precisa

Transformar um PDF digitalizado em texto são na verdade dois trabalhos diferentes, e o conversor permite escolher qual deles executar. Um PDF que já contém caracteres reais só precisa ser lido. Um PDF que contém imagens das páginas precisa ser reconhecido primeiro, porque ainda não há texto dentro dele.

Você consegue diferenciá-los em um segundo. Abra o arquivo em qualquer leitor e tente selecionar uma linha. Se as palavras forem destacadas, o PDF tem uma camada de texto, então escolha Converter e o texto sai exatamente como foi escrito. Se nada for destacado, ou se a página inteira for destacada como um bloco só, é uma digitalização e precisa de reconhecimento óptico de caracteres.

Essa única escolha explica a maior parte dos resultados decepcionantes que as pessoas obtêm em outros lugares. Um conversor que executa um único caminho para cada envio retorna texto limpo para alguns arquivos e uma página vazia para outros, sem explicar nenhum dos dois. Escolher o mecanismo por conta própria elimina a adivinhação.

Como copiar texto de documentos PDF digitalizados

Uma digitalização não permite arrastar o cursor por uma frase, porque não há nada ali para selecionar. Extrair o texto de um PDF digitalizado resolve isso: envie o arquivo, execute a conversão e você obtém um arquivo de texto simples do qual pode copiar, colar em um e-mail ou pesquisar com o comando localizar em qualquer editor.

A saída é um arquivo .txt, então ele abre em qualquer computador e em qualquer celular sem software especial. Ele mantém as palavras e as quebras de linha e deixa o layout de lado, que é a troca certa quando o que você quer é o conteúdo e não uma cópia da página.

Várias digitalizações podem ser enviadas de uma vez. Cada PDF é convertido separadamente e volta como seu próprio arquivo de texto, com o mesmo mecanismo e a mesma seleção de idioma aplicados a todos.

O que é um arquivo TXT?

A extensão .txt é usada para arquivos de texto simples. Esses arquivos contêm linhas de texto e podem ser abertos em vários editores de texto em diferentes plataformas e dispositivos. O texto não contém nenhuma formatação.

É por isso que este é o lugar mais seguro para guardar o texto recuperado de uma digitalização. Nada no arquivo fica desatualizado, nada precisa de licença para abrir e as palavras continuam legíveis muito depois de o programa que produziu o original ter sido substituído.

Extensão de arquivo: .txt, tipo MIME: text/plain

TXT na Wikipedia

Qual mecanismo de OCR escolher

Há 5 maneiras de ler um PDF digitalizado aqui, e o painel de configurações permite alternar entre elas. Escolha a que corresponde ao arquivo na sua frente.

Mecanismo de OCR Escolha quando
Converter O PDF já tem texto selecionável. Nenhum reconhecimento é executado, então as palavras saem exatamente como foram escritas.
OCR padrão A digitalização está limpa, reta e nítida. Este é o caminho mais rápido de um PDF digitalizado para texto.
OCR IA avançado A digitalização está fraca, em baixa resolução ou um pouco torta, e o mecanismo padrão perde caracteres.
OCR IA avançado+ A página tem sombras, iluminação irregular ou lombada curva, o que é comum quando um livro é fotografado.
OCR de foto O texto foi fotografado em vez de digitalizado, por exemplo uma placa, um rótulo ou uma tela.

O conversor reconhece 124 idiomas de origem, incluindo chinês simplificado e tradicional com layouts verticais e as formas cirílicas de azeri, sérvio e uzbeque. Selecione todos os idiomas que aparecem no seu arquivo.

Motivos comuns para converter um PDF digitalizado em texto

As palavras em uma digitalização ficam presas dentro de uma imagem. Estas são as situações em que tirá-las de lá poupa mais trabalho.

Documentos que você precisa pesquisar

Faturas, contratos, recibos e cartas geralmente chegam como digitalizações. Com o texto extraído você pode buscar um valor, uma data ou um nome em vez de ler cada página.

Material de estudo e pesquisa

Digitalizações de biblioteca, artigos de revistas e páginas de livros passam a poder ser citados. Extraia o texto uma vez e cole os trechos de que precisa nas suas anotações em vez de digitá-los de novo.

Registros e arquivos

Arquivos antigos muitas vezes são guardados como longas digitalizações com várias páginas. Envie vários de uma vez e o conversor processa o lote em uma única execução.

Seus dados, protegidos

Os papéis que você digitaliza e os documentos que você converte podem ser pessoais. Veja exatamente como os seus são tratados.

Criptografia TLS

Todo upload e download ocorre por uma conexão criptografada, para que seus arquivos não possam ser lidos em trânsito.

Sem acesso humano

O reconhecimento de texto é totalmente automatizado. Ninguém lê suas digitalizações ou documentos, e nada é compartilhado com terceiros.

Encrypted at rest

Stored on servers with full-disk encryption, and backups are encrypted too.

Como converter um PDF digitalizado em texto

1

Enviar

Envie o PDF digitalizado.

2

Escolher

Escolha o mecanismo de OCR que combina com o seu arquivo. Use Converter se o texto no PDF já for selecionável.

3

Ajustar

Escolha o idioma do seu PDF para obter melhores resultados (opcional).

4

Converter

Inicie a conversão e aguarde até que o download esteja pronto.

PDF digitalizado para texto - Perguntas frequentes

Este conversor de PDF digitalizado para texto é gratuito?

Sim. Converter um PDF digitalizado em texto é gratuito e não exige conta. Envie o arquivo, escolha um mecanismo e baixe o resultado. Arquivos de até 100 MB estão dentro do limite grátis, e um plano só importa para arquivos maiores e lotes mais longos.

Posso aplicar OCR a um PDF grátis?

Sim. O OCR padrão é o mecanismo gratuito e lida com digitalizações comuns sem cadastro. Os 3 mecanismos avançados de IA são a opção para páginas que o mecanismo padrão não consegue ler, como cópias fracas ou fotos tiradas com pouca luz.

Por que meu PDF digitalizado precisa de OCR para extrair o texto?

Porque o arquivo contém imagens das páginas em vez de caracteres. Um scanner fotografa o papel, então cada palavra é um padrão de pixels. O reconhecimento óptico de caracteres lê esses pixels e escreve caracteres reais, o que torna o texto selecionável, pesquisável e editável.

Como copio texto de um PDF digitalizado?

Envie o PDF acima, escolha um mecanismo de OCR e inicie a conversão. O resultado é um arquivo de texto simples que você pode abrir em qualquer editor e copiar dele. Copiar diretamente de um leitor de PDF só funciona depois que o arquivo tiver uma camada de texto.

Quais idiomas o reconhecimento de texto consegue ler?

Ele reconhece 124 idiomas de origem, incluindo chinês nas formas simplificada e tradicional com layouts verticais, e as variantes cirílicas de azeri, sérvio e uzbeque. Selecione todos os idiomas que aparecem no arquivo, porque uma página mista é lida melhor quando todos eles estão listados.

Posso converter um PDF digitalizado para Word?

Não a partir desta página, que cria um arquivo de texto simples. Ela mantém as palavras e descarta o layout. Para um DOC ou DOCX com formatação, use o aplicativo Converter para Word, que executa o mesmo reconhecimento de texto e gera um documento do Word.

Por que o texto extraído saiu errado?

A qualidade do reconhecimento acompanha a qualidade da digitalização. Uma página torta, baixa resolução, uma sombra sobre o papel ou uma foto tirada à mão reduzem a precisão. Tente IA-OCR avançado para digitalizações imperfeitas e IA-OCR+ avançado para iluminação ruim, e redigitalize a 300 dpi sempre que possível. Um arquivo de origem protegido por senha ou danificado não será convertido.

Meus documentos digitalizados são privados?

Sim. Uploads e downloads usam conexão criptografada, o processamento acontece em data centers certificados dentro da União Europeia e todo o fluxo é automatizado, então ninguém lê suas digitalizações. Seus arquivos nunca são usados para treinar modelos de IA e você mantém os direitos sobre eles.

Mais sobre reconhecimento de texto

Um livro aberto sobre uma mesa amarela, emoldurado por suportes de scanner, com o título do artigo Salve texto valioso com OCR impresso na página
Como

Salve textos valiosos com OCR

Digitalize textos valiosos de documentos escaneados e imagens com OCR (Reconhecimento Óptico de Caracteres). Extraia texto de imagens facilmente, online.

Ler artigo