Met Tabula kun je een tabel uit een PDF-bestand selecteren en extraheren en vervolgens de informatie opslaan in CSV, TSV, enzovoort. Het platform stelt je ook in staat om een rij of kolom te selecteren om de gegevens in een PDF-bestand op te slaan. In tegenstelling tot andere programma's die de gegevens uit een tabel in een PDF-bestand extraheren, onderscheidt Tabula zich door zijn eenvoud en doeltreffendheid bij het extraheren van tabellen.
Zodra je het programma van de officiële website hebt gedownload, zie je een CMD-venster worden uitgevoerd en wordt er een tabblad geopend in de standaardwebbrowser van je computer, dat de interface van de omgeving zal zijn (http://127.0.0.1:8080/).
- Het eerste wat je moet doen is het PDF-bestand op je computer zoeken en vervolgens op de knop "Import" te klikken. Op dit punt zal het hulpprogramma het PDF-bestand laden in het tabblad van de webbrowser en het in pagina's verdelen.
- Kies nu de pagina waaruit je de tabellen wilt extraheren en selecteer met de muis de tabel (of een deel ervan). Klik vervolgens op de groene knop boven in de interface.
- Je gaat naar een volgende stap van het proces, waar je de extractie van de tabelinhoud zult zien. Je hoeft alleen nog het uitvoerformaat te selecteren (CSV, TSV, JSON, ZIP van CSV of Script). Om de extractie af te ronden, moet je op de knop Exporteren klikken of de informatie in het klembord opslaan.
Zoals je kunt zien, is het werken met de omgeving echt eenvoudig. Als je het wat gemakkelijker wilt maken, kun je op de knop Autodetected Tables klikken en het platform zal alle tabellen van alle pagina's van het PDF-bestand detecteren en ze extraheren in het door jou gekozen formaat.
De tool is echt een van de eenvoudigste opties om tabellen uit een PDF-bestand te extraheren, maar de functie om alle tabellen van een document te detecteren en ze in één bestand te extraheren, onderscheidt het van vergelijkbare hulpprogramma's. Tabula is een gratis programma dat beschikbaar is voor de besturingssystemen Windows en Mac OS X.