Show GN: PDF 번역에서 텍스트보다 레이아웃이 더 어려워서 문서 단위 번역 도구를 만들었습니다

4 hours ago 4

안녕하세요. PDF를 번역하다 보면 번역 품질 자체보다 의외로 문서 구조가 깨지는 문제가 더 불편한 경우가 많았습니다. 일반 번역기에 PDF의 텍스트를 넣으면 문장 자체는 번역되지만, 표의 행과 열이 뒤섞이거나 제목과 본문의 관계가 사라지고 수식이나 특수문자가 변형되거나 이미지와 설명이 분리되고 스캔 PDF는 아예 텍스트를 가져오지 못하는 문제가 생기곤 합니다. 그래서 PDF 파일 자체를 입력으로 받아 번역하고, 가능한 한 원래 문서의 구조를 유지하는 PDF Translate를 만들었습니다. 현재 구현한 기능 디지털 PDF 전체 번역 스캔 PDF OCR 및 번역 제목, 문단, 폰트와 페이지 구조 유지 표와 이미지가 포함된 문서 처리 수식이나 특정 문자를 보호하는 옵션 여러 번역 엔진 선택 60개 이상의 언어 지원 번역본만 있는 PDF 출력 원문과 번역문을 함께 볼 수 있는 이중 컬럼 PDF 긴 문서 요약 PDF 내용에 질문하기 특히 신경 쓴 부분은 “번역된 텍스트”가 아니라 “다시 읽을 수 있는 문서”를 만드는 것이었습니다. 논문이나 기술 문서처럼 표, 수식, 각주가 많은 PDF는 텍스트만 잘 번역되어도 실제로 읽기가 어려울 수 있어서, 문서의 위치 관계와 구조를 가능한 한 유지하려고 했습니다. 스캔 PDF 스캔본은 먼저 OCR이 필요하기 때문에 일반 PDF보다 난도가 높았습니다. OCR 단계에서 숫자나 특수문자가 잘못 인식되면 이후 번역이 자연스럽게 보여도 원문과 다른 결과가 될 수 있어서, 스캔 품질이 좋지 않은 문서는 여전히 확인이 필요합니다. 그래도 텍스트 레이어가 없는 오래된 문서나 스캔 논문도 같은 워크플로우 안에서 처리할 수 있도록 만들었습니다. 단일 번역본 vs 이중 컬럼 처음에는 번역된 PDF만 있으면 충분하다고 생각했는데, 실제로 긴 문서를 검토할 때는 원문과 번역문을 같이 보는 경우가 많았습니다. 그래서 현재는 두 가지 방식으로 다운로드할 수 있습니다. 번역문만 포함된 PDF 원문과 번역문을 나란히 보여주는 PDF 논문, 계약서, 기술 문서처럼 용어나 숫자를 다시 확인해야 하는 경우에는 두 번째 방식이 꽤 유용합니다. 번역 전에 문서를 먼저 이해하기 긴 PDF는 모든 페이지를 바로 번역하는 것보다, 이 문서가 어떤 내용인지 요약하고 필요한 부분이 어느 페이지인지 찾고 특정 내용을 질문한 뒤 실제로 필요한 부분을 자세히 읽는 흐름도 필요하다고 생각했습니다. 그래서 전체 번역 외에 문서 요약과 ...

Read Entire Article