Skip to content

Latest commit

 

History

6 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 

Repository files navigation

made With Created Last Commit contributors issues counter repo size files counter Latest Tag downloads counter Maintainability Code Coverage

PyPDF Saw Text

PyPDF Saw Text é uma aplicação desktop escrita em Python que insere a tecnologia OCR (Optical Character Recognition – Reconhecimento Óptico de Caracteres) em documentos no formato PDF. Até o momento apenas o idioma Português (Brasil) é suportao. A ferramenta permite que o usuário selecione uma pasta contendo arquivos PDF e, de forma automatizada, converta todos os documentos encontrados em versões com texto reconhecível. E não há limite predefinido de arquivos: todos os PDFs válidos encontrados na pasta selecionada serão processados sequencialmente.

O PyPDF Saw Text é uma ótima maneira de tornar seus PDFs pesquisáveis sem esforço — tudo isso sem necessidade de instalar tranqueiras ou digitar comandos.

📥 Download

Get it on GitHub
  • Não é necessário ter Python instalado para executar a aplicação. O interpretador está incluso!
  • ⚠️ O Tesseract e Ghostscript já estão embutidos na pasta bin/ da aplicação.

Funcionalidades

  • Definir pasta de origem dos documentos: Permite escolher a pasta que contém todos os arquivos PDF a serem convertidos, sem limite máximo de documentos;
  • Definir pasta de saída dos documentos: Define o local onde os arquivos convertidos serão salvos. Os PDFs manterão os mesmos nomes dos arquivos originais, sem a necessidade de renomeá-los manualmente;
  • Acesso ao repositório do desenvolvedor: Um link localizado no rodapé da aplicação direciona diretamente para este repositório;
  • Reconhecimento Óptico de Caracteres (OCR): O texto dos documentos será reconhecido em Português (Brasil) utilizando a tecnologia do Tesseract;
  • Compressão: O novo PDF tende a ocupar menos espaço em disco. Já que a ferramenta utiliza o Ghostscript para comprimir imagens e dados internos do arquivo, sem alterar seu conteúdo.

Tecnologias Utilizadas

  • Python 3.13.0: Linguagem de programação utilizada;
  • CustomTkinter: Biblioteca que cria a interface gráfica;
  • ocrmypdf: Biblioteca que extrai as páginas do PDF como imagens;
  • Tesseract OCR: Ferramenta OpenSource que usa OCR para converter as imagens em texto reconhecível;
  • Ghostscript: Ferramenta OpenSource para reescrever um novo PDF válido e com tamanho otimizado;
  • cx_Freeze: Biblioteca que cria versões executáveis da aplicação para diferentes arquiteturas.

Demonstração

Demonsraoção

Como Reproduzir e executar?

  1. O projeto utiliza o Python 3.13.0:
  1. Clone este repositório usando comando abaixo:
git clone https://github.com/alanmugiwara/pypdfsawtext
  1. Navegue até o diretório /src:
cd pypdfsawtext/src
  1. Instale as dependências de Python necessárias para o projeto:
pip install -r requirements.txt
  1. Instale as dependências necessárias para a aplicação:

Windows

Ghostscript/GhostPDL 10.05.1
tesseract-ocr/tesseract · v5.5.0.20241111

GNU/Linux (Ubuntu/Debian) e derivados

sudo apt install ghostscript && apt install tesseract-ocr tesseract-ocr-por -y
  1. Execute o Programa:
python main.py

Como fazer o Build?

  1. O projeto utiliza o Python 3.13.0:
  1. Clone este repositório usando comando abaixo:
git clone https://github.com/alanmugiwara/pypdfsawtext
  1. Instale as dependências de Python necessárias para o projeto:
pip install -r requirements.txt
  1. Instale as dependências necessárias para a aplicação:

Para Windows

Ghostscript/GhostPDL 10.05.1
tesseract-ocr/tesseract · v5.5.0.20241111

Para GNU/Linux (Ubuntu/Debian) e derivados

sudo apt install ghostscript && apt install tesseract-ocr tesseract-ocr-por -y
  1. Navegue até o diretório /src:
cd pypdfsawtext/src
  1. No Windows - Rode o comando abaixo para buildar:
python setup_win.py build_exe

Requisitos para rodar o executável

Para Windows

Windows 10+ 64 bits
Visual C++ RedistributableMicrosoft Visual C++ Redistributable 2015–2022 (x64)

About

PyPDF Saw Text é uma ferramenta gráfica e leve escrita em Python que transforma PDFs escaneados em documentos com texto reconhecível e pesquisável.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Used by

Contributors

Languages