PDF 텍스트 인식(OCR) — 업로드 없이
스캔했거나 이미지로 되어 있는 PDF 페이지 위에 보이지 않는 검색 가능한 텍스트 레이어를 추가합니다. 인식은 브라우저에서 완전히 실행되며, 파일이 업로드되는 일은 없습니다.
3단계로 완료
PDF 열기
스캔했거나 이미지 기반인 PDF를 드래그 앤 드롭하거나 선택하세요.
언어 및 범위 선택
인식 언어를 지정하고, 현재 페이지만 인식할지 전체 문서를 인식할지 결정하세요.
내보내기
검색 가능한 보이지 않는 텍스트 레이어가 포함된 PDF로 저장하세요 — 페이지 이미지는 시각적으로 그대로 유지됩니다.
대표적인 사례: 스캔한 문서를 검색 가능하게 만들기
스캔한 계약서, 청구서, 책은 대개 페이지 이미지만 있을 뿐 실제 텍스트가 없습니다 — 검색도, 텍스트 복사도 할 수 없습니다. mousePDF는 브라우저에서 로컬로 텍스트를 인식해 이미지 위에 보이지 않게 배치하므로, 페이지의 겉모습은 그대로 유지하면서 검색과 복사가 가능해집니다.
브라우저에서의 텍스트 인식 — 특별한 점
OCR은 보통 업로드를 피하기 거의 불가능한 작업 중 하나입니다: 인식에는 언어 모델이 필요하고, 이는 대개 서버에 있습니다. 여기서는 브라우저에서 실행되며, 로드되는 것은 모델뿐이고 파일은 절대 로드되지 않습니다.
이는 바로 스캔하는 문서에서 중요합니다: 계약서, 급여명세서, 진단서, 신분증 사본. 스캔은 이미지이며, 검색 가능해지기 전에 무언가가 그것을 읽어야 합니다. 이 '무언가'가 당신 자신의 기기, 당신의 브라우저에서 실행된다는 점이 진짜 차이입니다.
OCR에는 28개 언어를 사용할 수 있습니다. 선택한 언어의 모델은 실제 실행 시점에만 불러와지므로, 페이지 자체는 가볍게 유지되고 필요한 것만 내려받습니다.
인식의 한계
비라틴 문자는 의도적으로 제외되었습니다. 키릴 문자, 중국어, 일본어, 한국어, 아랍어, 히브리어, 데바나가리, 태국어는 지원하지 않습니다. 이런 문자를 위한 모델은 훨씬 크고 인식률도 눈에 띄게 낮습니다 — 한 글자씩 다시 고쳐야 하는 결과는 누구에게도 도움이 되지 않습니다. 그리스어는 이 점에서 같은 부류에 속하지 않기 때문에 포함되어 있습니다.
인식은 결코 완벽하지 않습니다. 픽셀에서 한때 텍스트였던 것을 다시 읽어내는 방식입니다. 깨끗하고 반듯한 스캔은 매우 좋은 결과를 내지만, 조명이 나쁜 곳에서 비뚤게 찍은 스마트폰 사진, 알아보기 힘든 손글씨, 특이한 장식체 글꼴은 결과가 눈에 띄게 나쁩니다. 인식된 텍스트를 계속 사용하려면 검토가 필요합니다 — 이는 mousePDF뿐 아니라 모든 OCR 처리 결과물에 해당합니다.
페이지의 겉모습은 바뀌지 않습니다. 인식된 텍스트는 이미지 위에 보이지 않는 레이어로 놓입니다: 스캔 이미지는 그대로 보이지만 그 안에서 검색하고 선택할 수 있습니다. 따라서 인식 오류는 이미지에서 보이지 않으며, 텍스트를 복사할 때 비로소 드러납니다.
PDF 압축 이후에도 OCR이 유용합니다: 이 과정에서 페이지가 이미지로 바뀌면서 텍스트 레이어를 잃게 되는데, 텍스트 인식이 이를 다시 만들어 줍니다.
자주 묻는 질문
텍스트 인식을 위해 제 문서가 업로드되나요? +
아니요. 인식은 로컬로 불러온 OCR 엔진을 통해 브라우저에서 완전히 실행됩니다 — 파일은 절대 기기를 벗어나지 않습니다.
어떤 언어가 지원되나요? +
라틴 문자 또는 그리스 문자를 사용하는 다양한 유럽 언어입니다. 중국어, 아랍어, 키릴 문자, 데바나가리 같은 문자는 현재 OCR에서 지원되지 않습니다.
인식에는 얼마나 걸리나요? +
페이지 수와 기기 성능에 따라 몇 초에서 몇 분 정도 걸립니다.
텍스트 인식이 페이지의 겉모습을 바꾸나요? +
아니요. 페이지 이미지는 정확히 그대로 유지되며, 인식된 텍스트 레이어는 그 위에 보이지 않게 놓입니다 — 이를 통해 검색과 복사만 가능해집니다.
제대로 스캔되지 않았거나 손글씨로 된 문서는 인식이 얼마나 잘 되나요? +
깔끔하게 인쇄되고 읽기 쉬운 텍스트에서 인식이 가장 잘 작동합니다. 손글씨 메모나 노이즈가 심한 스캔에서는 정확도가 떨어져 일부 문자가 잘못 인식되거나 누락될 수 있습니다.
어떤 언어를 인식할 수 있나요? +
28개 언어이며, 모두 라틴 문자와 그리스 문자입니다. 키릴 문자, 중국어, 아랍어, 히브리어, 태국어 같은 비라틴 문자는 의도적으로 제외되어 있습니다 — 그런 문자에서는 인식률이 눈에 띄게 낮아지기 때문입니다.
인식은 얼마나 정확한가요? +
깨끗하고 반듯한 스캔에서는 매우 정확하지만, 비뚤게 찍힌 스마트폰 사진, 조명이 나쁜 경우, 손글씨에서는 눈에 띄게 정확도가 떨어집니다. 텍스트를 계속 사용하려면 검토하는 것이 좋습니다.
텍스트 인식 후 제 문서가 다르게 보이나요? +
아니요. 인식된 텍스트는 이미지 위에 보이지 않는 레이어로 추가됩니다 — 페이지는 이전과 똑같아 보이지만 검색이 가능해집니다.
이런 도구도 도움이 될 수 있습니다
PDF 압축
이미지가 많은 PDF를 크게 줄이세요 — 이 과정에서 페이지가 이미지로 바뀝니다.
PDF를 PDF/A로 변환
관공서 제출과 장기 보관에 적합한 아카이브용 PDF/A 형식으로 변환하세요.
PDF를 Word로 변환
PDF 텍스트를 편집 가능한 Word 파일로 내보내세요 — 업로드 없이.
PDF 텍스트 편집
PDF의 기존 텍스트를 클릭해 새 텍스트로 바꾸세요.