Skip to content

feat: PDF 파서 추가 - #1

Merged
wkdgus1164 merged 1 commit into
mainfrom
feature/add-pdf-parser
Feb 11, 2026
Merged

feat: PDF 파서 추가#1
wkdgus1164 merged 1 commit into
mainfrom
feature/add-pdf-parser

Conversation

@wkdgus1164

Copy link
Copy Markdown
Member

개요

pymupdf (fitz)를 사용한 PDF 텍스트 추출 기능을 추가했어요.

변경사항

  • ✅ PDF 파일에서 텍스트 추출
  • ✅ 페이지별 텍스트 파싱 및 문단 분리
  • ✅ PDF 메타데이터 추출 (제목, 작성자, 페이지 수)
  • ✅ 자동 파서 등록 (.pdf 확장자)

사용 예시

from ureca_document_parser import convert

# PDF를 Markdown으로 변환
convert("document.pdf", "output.md")

# LangChain 청크로 변환
chunks = convert("document.pdf", chunks=True)

설치

uv add "ureca_document_parser[pdf]"

테스트

  • 로컬에서 lint/format 통과
  • 실제 PDF 파일로 테스트 필요

🤖 Generated with Claude Code

기능:
- pymupdf (fitz)를 사용한 PDF 텍스트 추출
- 페이지별 텍스트 추출 및 문단 분리
- PDF 메타데이터 추출 (제목, 작성자, 페이지 수)

사용법:
```python
from ureca_document_parser import convert

# PDF를 Markdown으로 변환
convert("document.pdf", "output.md")

# LangChain 청크로 변환
chunks = convert("document.pdf", chunks=True)
```

선택적 의존성:
```bash
uv add "ureca_document_parser[pdf]"
```

Co-Authored-By: Claude Sonnet 4.5 <noreply@anthropic.com>
@wkdgus1164
wkdgus1164 merged commit e4ea9b2 into main Feb 11, 2026
1 of 3 checks passed
@wkdgus1164
wkdgus1164 deleted the feature/add-pdf-parser branch February 11, 2026 07:39
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant