스캔 PDF에서 텍스트 추출

이 도구는 스캔한 PDF를 편집 가능한 텍스트로 변환하여 텍스트를 쉽게 복사, 편집하고 내용을 추가할 수 있게 해줍니다.

파일 업로드

또는 파일을 끌어다 놓거나, 붙여넣거나, 클라우드에서 선택하세요

URL 붙여넣기 샘플 사용
Google Drive Dropbox OneDrive
100% 무료 설치 필요 없음 안전하고 개인 정보 보호
광고
신뢰받는 서비스
eBay Booking.com University of Michigan Cornell University Columbia University
이 도구 평가하기
0/5 · 0 투표

스캔한 PDF에 OCR이 필요할 때와 필요하지 않을 때

스캔한 PDF를 텍스트로 바꾸는 작업에는 두 가지 방식이 있고, 변환기에서 어느 방식을 사용할지 선택할 수 있습니다. 이미 실제 문자 데이터가 들어 있는 PDF는 그 텍스트만 읽어 내면 됩니다. 페이지 이미지로만 이루어진 PDF는 안에 텍스트가 전혀 없기 때문에 먼저 인식 과정을 거쳐야 합니다.

두 경우는 금방 구분할 수 있습니다. 아무 리더에서나 파일을 열고 한 줄을 드래그해 보세요. 단어가 하이라이트되면 PDF에 텍스트 레이어가 있는 것이므로, 변환을 선택하면 텍스트가 원문 그대로 추출됩니다. 아무 것도 선택되지 않거나 페이지 전체가 하나의 블록처럼 선택되면 스캔본이며 광학 문자 인식이 필요합니다.

이 한 가지 선택이 다른 곳에서 결과가 만족스럽지 않은 대부분의 이유를 설명해 줍니다. 업로드마다 한 가지 방식만 쓰는 변환기는 어떤 파일에서는 깔끔한 텍스트를 내보내고, 어떤 파일에서는 아무 설명도 없이 빈 페이지를 내보냅니다. 엔진을 직접 고르면 이런 시행착오를 피할 수 있습니다.

스캔한 PDF 문서에서 텍스트를 복사하는 방법

스캔본에서는 선택할 텍스트가 없기 때문에 문장 위로 커서를 드래그할 수 없습니다. 스캔한 PDF에서 텍스트를 추출하면 이 문제가 해결됩니다. 파일을 업로드하고 변환을 실행하면, 어느 편집기에서나 열어 복사하거나 이메일에 붙여 넣고, 찾기 기능으로 검색할 수 있는 일반 텍스트 파일을 얻을 수 있습니다.

결과물은 .txt 파일이므로, 어떤 컴퓨터나 휴대폰에서도 별도 프로그램 없이 열립니다. 단어와 줄바꿈은 유지하고 레이아웃은 버리기 때문에, 페이지 모양이 아니라 내용이 중요한 경우에 알맞은 선택입니다.

여러 개의 스캔을 한 번에 올릴 수 있습니다. 각 PDF는 개별적으로 변환되어 각각의 텍스트 파일로 돌아오며, 모두 같은 엔진과 언어 설정이 적용됩니다.

TXT 파일이란?

.txt 파일 확장자는 일반 텍스트 파일에 사용됩니다. 이 파일에는 여러 줄의 텍스트가 들어 있으며, 다양한 플랫폼과 기기에서 여러 텍스트 편집기로 열 수 있습니다. 텍스트에는 서식 정보가 포함되지 않습니다.

그래서 스캔에서 되살린 텍스트를 보관하기에 가장 안전한 형식입니다. 파일이 오래되어도 달라질 것이 없고, 여는 데 라이선스가 필요하지 않으며, 원본을 만든 프로그램이 바뀐 뒤에도 텍스트는 계속 읽을 수 있습니다.

파일 확장자: .txt, MIME 타입: text/plain

위키백과의 TXT

어떤 OCR 엔진을 선택할지

여기에는 스캔한 PDF를 읽는 방법이 5가지 있으며, 설정 패널에서 이들 사이를 전환할 수 있습니다. 지금 작업하는 파일에 맞는 방식을 고르세요.

OCR 엔진 이럴 때 선택
변환 PDF에 이미 선택 가능한 텍스트가 있는 경우. 인식 과정이 실행되지 않으므로 단어가 원문 그대로 추출됩니다.
표준 OCR 스캔이 깨끗하고 곧고 선명한 경우. 스캔한 PDF에서 텍스트로 가는 가장 빠른 경로입니다.
고급 AI-OCR 스캔이 흐리거나 해상도가 낮거나 약간 기울어져 있어 표준 엔진이 글자를 놓치는 경우.
고급 AI-OCR+ 책을 촬영했을 때처럼 페이지에 그림자, 고르지 않은 조명, 휘어진 책등이 있는 경우.
사진 OCR 텍스트가 스캔이 아니라 사진으로 찍힌 경우. 예: 간판, 라벨, 화면 등.

이 변환기는 124개 원본 언어를 인식하며, 세로 쓰기를 포함한 중국어 간체 및 번체와 아제르바이잔어, 세르비아어, 우즈베크어의 키릴 문자 형식을 지원합니다. 파일에 나타나는 모든 언어를 선택하세요.

스캔한 PDF를 텍스트로 변환하는 흔한 이유

스캔본의 단어는 이미지 안에 잠겨 있습니다. 이런 상황에서 텍스트를 꺼내면 작업을 가장 크게 줄일 수 있습니다.

검색이 필요한 서류

송장, 계약서, 영수증, 편지는 대부분 스캔본으로 도착합니다. 텍스트를 추출해 두면 모든 페이지를 읽는 대신 금액, 날짜, 이름을 바로 검색할 수 있습니다.

학습 및 연구 자료

도서관 스캔, 저널 논문, 책 페이지를 인용할 수 있게 됩니다. 한 번 텍스트를 추출해 두고 필요한 구절을 노트에 붙여 넣으면 다시 타이핑할 필요가 없습니다.

기록 및 아카이브

예전 파일은 여러 페이지가 긴 스캔본으로 보관된 경우가 많습니다. 이런 파일을 여러 개 한꺼번에 업로드하면 변환기가 한 번에 일괄 처리합니다.

데이터 보호

직접 스캔한 문서와 변환하는 파일에는 개인 정보가 들어 있을 수 있습니다. 이 파일들이 어떻게 처리되는지 아래에 안내합니다.

TLS 암호화

모든 업로드와 다운로드는 암호화된 연결을 통해 전송되어, 전송 중 파일을 읽을 수 없습니다.

사람이 열람하지 않음

텍스트 인식은 완전히 자동으로 수행됩니다. 누구도 사용자의 스캔본이나 문서를 열람하지 않으며, 어떤 내용도 제3자와 공유되지 않습니다.

ISO 27001 데이터 센터

처리는 유럽 연합 내의 인증된 데이터 센터에서 이루어집니다.

스캔한 PDF를 텍스트로 변환하는 방법

1

업로드

스캔한 PDF를 업로드하세요.

2

선택

파일에 맞는 OCR 엔진을 선택하세요. PDF 안의 텍스트가 이미 선택 가능한 경우에는 변환을 사용하세요.

3

조정

더 나은 결과를 위해 PDF의 언어를 선택하세요(선택 사항).

4

변환

변환을 시작하고 다운로드 준비가 완료될 때까지 기다리세요.

스캔한 PDF를 텍스트로 - 자주 묻는 질문

이 스캔한 PDF를 텍스트로 변환하는 도구는 무료인가요?

예. 스캔한 PDF를 텍스트로 변환하는 작업은 무료이며 계정이 필요 없습니다. 파일을 업로드하고 엔진을 선택한 다음 결과를 다운로드하면 됩니다. 100MB까지의 파일은 무료 한도에 포함되며, 더 큰 파일이나 더 긴 일괄 작업에만 요금제가 필요합니다.

PDF에 OCR을 무료로 적용할 수 있나요?

예. 표준 OCR은 무료 엔진이며, 일반적인 스캔본은 회원 가입 없이 처리합니다. 고급 AI 엔진 3가지는 표준 엔진으로는 읽기 어려운 희미한 복사본이나 열악한 조명에서 찍은 사진용 업그레이드입니다.

왜 내 스캔한 PDF는 텍스트를 추출하려면 OCR이 필요한가요?

파일에 문자 대신 페이지 사진이 들어 있기 때문입니다. 스캐너는 종이를 사진으로 찍기 때문에, 모든 단어가 픽셀 패턴일 뿐입니다. 광학 문자 인식은 이 픽셀을 읽고 실제 문자를 작성해 주며, 그 결과 텍스트를 선택, 검색, 편집할 수 있게 됩니다.

스캔한 PDF에서 텍스트를 어떻게 복사하나요?

위에 PDF를 업로드하고 OCR 엔진을 선택한 뒤 변환을 시작하세요. 결과는 어떤 편집기에서나 열어 복사할 수 있는 일반 텍스트 파일입니다. PDF 리더에서 바로 복사하는 기능은 파일에 텍스트 레이어가 생긴 뒤에만 작동합니다.

텍스트 인식은 어떤 언어를 읽을 수 있나요?

이 도구는 세로 쓰기를 포함한 중국어 간체, 번체와 아제르바이잔어, 세르비아어, 우즈베크어의 키릴 문자 변형 등 124개 원본 언어를 인식합니다. 파일에 나타나는 모든 언어를 선택하세요. 여러 언어가 섞인 페이지는 모두 지정할 때 가장 잘 읽힙니다.

스캔한 PDF를 Word로 변환할 수 있나요?

이 페이지에서는 레이아웃을 버리고 텍스트만 남기는 일반 텍스트 파일만 생성합니다. 서식이 포함된 DOC 또는 DOCX 파일이 필요하다면, 같은 텍스트 인식을 사용해 Word 문서를 만드는 Word로 변환 앱을 사용하세요.

추출된 텍스트가 잘못 나온 이유는 무엇인가요?

인식 품질은 스캔 품질을 따릅니다. 페이지가 기울어져 있거나, 해상도가 낮거나, 종이에 그림자가 드리워져 있거나, 손으로 찍은 사진이면 정확도가 떨어집니다. 상태가 완전하지 않은 스캔에는 Advanced AI-OCR을, 조명이 나쁜 사진에는 Advanced AI-OCR+를 시도해 보고, 가능하다면 300dpi로 다시 스캔하세요. 암호로 보호되었거나 손상된 원본 파일은 변환되지 않습니다.

스캔한 문서는 비공개로 보호되나요?

예. 업로드와 다운로드는 암호화된 연결로 처리되고, 변환은 유럽 연합 내 인증된 데이터 센터에서 이루어지며, 전체 과정은 자동화되어 있어 아무도 스캔본을 열람하지 않습니다. 파일은 AI 모델 학습에 사용되지 않으며, 이용자는 항상 파일에 대한 권리를 유지합니다.

텍스트 인식 더 알아보기

노란 책상 위 스캐너 브래킷에 올려진 펼친 책과, 페이지 위에 Save Valuable Text With OCR라는 글 제목이 인쇄된 모습
사용 방법

OCR로 소중한 텍스트 저장

스캔한 문서와 이미지에서 OCR(광학 문자 인식)로 중요한 텍스트를 디지털화하세요. 이미지를 온라인에서 손쉽게 텍스트로 추출할 수 있습니다.

기사 읽기