PDF auslesen und verändern, was ist besser iText oder PDFBox ?

osix

Bekanntes Mitglied
Hallo Freunde,

für ein Projekt soll ich PDFs auslesen, aber auch Text in bestehenden PDFs verändern, dazu noch QR-Codes in PDFs durch andere ersetzen.

1) Stimmt es, daß Java dafür garnicht so geeignet ist ? Jemand "flüsterte" mir da sei Phython (die alte Schlange) einfach besser.

2) Nehme ich dann iText oder PDFBox, oder hat jedes seine Stärken und Schwächen, wenn ja, dann bitte diese kurz auflisten

Vielen Dank im Vorraus
 
Da hier niemand dein Projekt so gut kennt wie du kann dir auch keiner die Recherche abnehmen und beurteilen was für dich besser geeignet ist. Ein Anfang wäre hier z.B.: https://www.baeldung.com/pdf-conversions-java oder https://www.w3schools.blog/itext-edit-add-modify-write-an-existing-pdf-file-in-java. Ob Java besser oder schlechter geeignet ist als Phython kommt darauf auf, wenn dein Server ein Tomcat oder Wildfly ist, dann wirst du mit Phython nicht weit kommen. Läuft alles in einem Docker-Container hinter einem Proxy kann Phython die bessere Wahl sein.
 
Danke, es geht nur um ein TOOL, das einige Tausende von PDFs automatisch bearbeiten soll, kein Server, soll lokal laufen.
Es geht mir drum, ob die obigen Java Librarys das auch wirklich können ! PDFs VERÄNDERN, also Text finden und ersetzen ! Das muß sauber sein, da darf nachher keine andere Schrift sein,
oder ein paar Pixel verschiebung...
 
Danke, es geht nur um ein TOOL, das einige Tausende von PDFs automatisch bearbeiten soll, kein Server, soll lokal laufen.
Es geht mir drum, ob die obigen Java Librarys das auch wirklich können ! PDFs VERÄNDERN, also Text finden und ersetzen ! Das muß sauber sein, da darf nachher keine andere Schrift sein,
oder ein paar Pixel verschiebung...
PDF ist im Wesentlichen ein Subset von Postscript und dafür nicht ausgelegt. Bei einigen Dokumenten kann es funktionieren, bei anderen nicht, das hängt aber von verschiedenen Dingen ab. Wenn Du z. B. Dokumente hast, in denen Text in Kurven umgewandelt wurde, hast Du gar keinen Text zur Verfügung, dann gibt es Dokumente, die jeden Buchstaben einzeln setzen, da ist die Sache auch nicht gerade trivial. Hast Du Fließtext mit Trennungen usw.
 
powershell kann ganz gut pdfs einlesen und umwandeln in objekte und dann wieder zu pdfs machen.. brauchst dann nur paar zeilen code und als tool tuts powershell auch
 
Ich habe mal PDFs geparst und Whitespaces nach jedem Wortende eingefügt. Außerdem die Dokumenteigenschaften und Seiteneigenschaften verändert, Container und Tags eingefügt - alles ohne die BoundingBoxes der existierenden Objekte zu verändern. Das ging damals nur mit der Adobe PDF Library und etliche Zeilen Code. Jetzt möchte ich allerdings nur Dokument- und Seiteneigenschaften ändern und das möglichst komfortabel. Reicht da dann auch iText?
 
Die Tab-Order der Seite einstellen. Habe ich schon gefunden. Auch gelingt es einen Alternativtext bei Links hinzuzufügen. Allerdings gestaltet sich die Recherche nach Seitenobjekten (Image bzw. sonstige Objekte ohne Container) noch als schwierig bzw. scheint recht komplex zu sein - sie sollen "Artifact" werden. Ich muss PDFs barrierefrei nachbessern. Jetzt probiere ich es mal mit PDFBox.
 
Zuletzt bearbeitet:

Zurück
Oben