Com o Tabula você poderá selecionar e extrair uma tabela de um arquivo PDF e depois salvar as informações da mesma em formato CSV, TLS, etc. A plataforma também permite selecionar uma linha ou coluna, para salvar os dados em um arquivo PDF. Ao contrário de outros programas que extraem os dados de uma tabela de um arquivo PDF, o Tabula se caracteriza pela sua simplicidade e eficácia no momento da extração das tabelas.
Uma vez baixado o programa a partir do seu site oficial, você verá que uma janela CMD é executada e uma aba do navegador Web padrão do seu computador se abrirá, que será a interface do ambiente (http://127.0.0.1:8080/).
- A primeira coisa que você tem que fazer é buscar o arquivo PDF no seu computador e depois clicar no botão “Import”. Nesse ponto, o utilitário carregará o arquivo PDF na aba do navegador Web e o dividirá em páginas.
- Agora você escolhe a página da qual deseja extrair as tabelas e com o mouse seleciona a tabela (ou parte dela). Depois clique no botão verde localizado na parte superior da interface.
- Você passará para outro nível do processo, onde observará a extração do conteúdo da tabela. Só resta selecionar o formato de saída (CSV, TSV, JSON, ZIP de CSV ou Script). Para finalizar a extração, você terá que clicar no botão exportar ou salvar as informações na área de transferência.
Como você pode observar, trabalhar com o ambiente é realmente simples. Se quiser fazer as coisas um pouco mais fáceis, você pode clicar no botão “Autodetected Tables” e a plataforma detectará todas as tabelas de todas as páginas do PDF e as extrairá no formato que você selecionar.
Realmente a ferramenta é uma das opções mais simples para extrair tabelas de um arquivo PDF, mas sua função de detectar todas as tabelas de um documento e extraí-las em um arquivo único a destacam de outras utilidades similares. O Tabula é um programa gratuito que está disponível para sistemas operacionais Windows e Mac OS X.