Za pomocą Tabuli możesz zaznaczyć i wyodrębnić tabelę z pliku PDF, a następnie zapisać zawarte w niej informacje w formacie CSV, TSV itd. Platforma pozwala także wybrać konkretny wiersz lub kolumnę i zapisać je w pliku PDF. W przeciwieństwie do innych programów, które wyodrębniają dane z tabeli z pliku PDF, Tabula wyróżnia się prostotą i skutecznością podczas ekstrakcji tabel.
Po pobraniu programu z jego oficjalnej strony zobaczysz, jak uruchamia się okno CMD i jak otwiera się zakładka w domyślnej przeglądarce internetowej komputera, która będzie interfejsem środowiska (http://127.0.0.1:8080/).
Wyodrębnianie tabeli krok po kroku
- Pierwszą rzeczą, jaką musisz zrobić, jest znalezienie pliku PDF na swoim komputerze, a następnie kliknięcie przycisku „Import”. W tym momencie narzędzie załaduje plik PDF w zakładce przeglądarki i podzieli go na strony.
- Teraz wybierasz stronę, z której chcesz wyodrębnić tabele, i zaznaczasz tabelę (lub jej część) myszą. Następnie klikasz zielony przycisk znajdujący się w górnej części interfejsu.
- Przejdziesz do kolejnego etapu procesu, na którym zobaczysz wyodrębnianie zawartości tabeli. Pozostaje ci tylko wybrać format wyjściowy (CSV, TSV, JSON, ZIP CSV lub Script). Aby zakończyć ekstrakcję, kliknij przycisk eksportu albo zapisz informacje w schowku.
Automatyczne wykrywanie tabel
Jak widzisz, praca ze środowiskiem jest naprawdę prosta. Jeśli chcesz ułatwić sobie sprawę, możesz kliknąć przycisk „Autodetected Tables”, a platforma wykryje wszystkie tabele ze wszystkich stron pliku PDF i wyodrębni je w wybranym formacie.
Podsumowanie
To naprawdę jedno z najprostszych narzędzi do wyodrębniania tabel z pliku PDF, ale funkcja wykrywania wszystkich tabel w dokumencie i wyodrębniania ich do jednego pliku wyróżnia je spośród podobnych narzędzi. Tabula to darmowy program dostępny dla systemów Windows i Mac OS X.