PDF에서 문장을 복사하려다 실패한 경험은 흔합니다. 뷰어에서 드래그가 안 되거나, 복사한 결과에 줄바꿈이 엉망으로 섞여 들어오거나, 아예 글자가 선택되지 않기도 합니다. 이 도구는 PDF 안에 담긴 텍스트를 통째로 뽑아 복사하거나 TXT 파일로 저장합니다.
PDF에는 '줄'이라는 개념이 없다는 점이 이 작업을 까다롭게 만듭니다. 파일 안에는 글자 조각들이 좌표와 함께 흩어져 있을 뿐입니다. 이 도구는 세로 좌표가 바뀌는 지점을 줄바꿈으로 해석해 사람이 읽을 수 있는 형태로 복원합니다. 문서는 브라우저 안에서만 열리며 서버로 전송되지 않습니다.
사용 방법
- PDF 올리기 — 파일을 고르거나 끌어다 놓으면 곧바로 전체 페이지의 텍스트를 뽑아 보여 줍니다. 페이지가 많으면 잠시 걸립니다.
- 결과 확인하기 — 기본값은
--- 페이지 1 ---같은 구분선을 넣어 어느 쪽 내용인지 알 수 있게 합니다. 아래에 전체 글자 수가 표시됩니다. - 필요한 페이지만 다시 뽑기 — 더보기에서
1-3, 5같은 범위를 적고 적용을 누르면 그 페이지만 다시 추출합니다. 구분선이 필요 없으면 페이지 구분 표시를 끄세요. 이어지는 본문을 그대로 다른 곳에 옮길 때 편합니다. - 복사하거나 저장하기 — 오른쪽 위 복사 버튼으로 클립보드에 담거나 다운로드 버튼으로
.txt파일을 받습니다. 파일명은 원본 PDF 이름을 따릅니다.
자주 묻는 질문
텍스트가 하나도 안 나옵니다.
스캔해서 만든 PDF일 가능성이 큽니다. 종이를 촬영하거나 스캔한 문서는 페이지에 사진 한 장이 박혀 있을 뿐이고 글자 정보가 없습니다. 사람 눈에는 글자로 보이지만 파일 안에는 픽셀만 있습니다.
이 경우 이미지를 문자로 인식하는 OCR이 필요하며, 브라우저만으로 정확하게 처리하기는 어렵습니다. 뷰어에서 글자를 드래그해 선택할 수 있는지 먼저 확인해 보세요. 선택되지 않는다면 이 도구로도 뽑을 수 없습니다.
줄바꿈이 이상하게 들어갑니다.
PDF에 줄 개념이 없어서 생기는 근본적인 한계입니다. 이 도구는 글자 조각의 세로 좌표가 바뀌면 줄이 바뀐 것으로 봅니다.
대부분 잘 맞지만 2단 편집 논문이나 표, 각주가 섞인 문서에서는 좌우 단이 번갈아 섞이거나 표의 칸이 한 줄로 이어질 수 있습니다. 이런 문서는 페이지 범위를 좁혀 조금씩 뽑은 뒤 손으로 정리하는 편이 빠릅니다.
한글이 깨져서 나옵니다.
PDF에 글꼴이 포함되지 않았거나 특수한 방식으로 인코딩된 경우입니다. 글자를 화면에 그리는 정보만 있고 '이 모양이 어떤 문자인지'를 알려 주는 매핑이 빠져 있으면 뽑아낸 결과가 깨집니다.
오래된 프로그램으로 만든 PDF나 글꼴을 서브셋으로만 담은 문서에서 가끔 발생합니다. 이런 경우엔 원본 문서를 구해 다시 PDF로 내보내는 것 말고는 방법이 마땅치 않습니다.
표 안의 내용도 뽑히나요?
글자는 뽑히지만 표 구조는 사라집니다. PDF에는 '표'라는 정보가 없고 선과 글자가 각자의 좌표에 놓여 있을 뿐이기 때문입니다.
결과적으로 칸의 내용이 순서대로 나열됩니다. 표 데이터를 다시 표로 써야 한다면, 뽑은 텍스트를 CSV 형태로 정리한 뒤 CSV ↔ JSON 변환기로 넘기는 방법이 있습니다.
알아두면 좋은 개념
PDF가 글자를 담는 방식
PDF 안의 텍스트는 문서 편집기처럼 문단으로 구성되어 있지 않습니다. Tj 같은 연산자와 함께 '이 위치에 이 글꼴로 이 문자열을 그려라'라는 명령이 나열될 뿐입니다. 문단, 줄, 표는 사람이 보고 해석하는 것이지 파일에 적혀 있지 않습니다.
그래서 모든 PDF 텍스트 추출기는 좌표를 보고 구조를 추측합니다. 잘 만들어진 문서일수록 추측이 잘 맞고, 편집이 복잡한 문서일수록 결과가 흐트러집니다. 최근 PDF 표준에는 구조 정보를 담는 '태그' 기능이 있지만 실제로 넣는 문서는 많지 않습니다.
복사 금지가 걸린 PDF
PDF에는 인쇄·복사·편집을 제한하는 권한 설정이 있습니다. 하지만 이건 암호화가 아니라 '뷰어에게 하지 말라고 부탁하는' 표시에 가깝습니다. 내용 자체는 평문으로 들어 있고, 표준을 따르는 뷰어가 자발적으로 그 요청을 존중할 뿐입니다.
그래서 복사 금지가 걸린 문서도 텍스트가 추출되는 경우가 많습니다. 기술적으로 막혀 있지 않다는 뜻입니다. 다만 권한 설정은 저작권자의 의사 표시이므로, 추출한 내용을 어떻게 쓸지는 별개로 판단해야 합니다.
뽑은 텍스트를 다듬는 순서
추출 결과를 바로 쓰기보다 몇 단계를 거치면 훨씬 깔끔해집니다. 먼저 페이지마다 반복되는 머리말·꼬리말과 쪽 번호를 지웁니다. 검색·치환으로 한 번에 처리할 수 있습니다.
다음으로 문장 중간에서 끊긴 줄을 잇습니다. 원본의 줄바꿈이 그대로 남아 문장이 토막 나 있는 경우가 많은데, 마침표로 끝나지 않는 줄바꿈을 공백으로 바꾸면 대부분 복원됩니다. 마지막으로 연속된 빈 줄을 정리하면 됩니다. 이 사이트의 중복 제거·정렬 도구와 정규식 테스터를 쓰면 이 과정을 빠르게 처리할 수 있습니다.