Java PDF-Einlesen

  • Themenstarter Themenstarter Gast2
  • Beginndatum Beginndatum
G

Gast2

Gast
Hallo zusammen,

welche Apis bzw. Frameworks gibt es in Java um PDF-Dateien (wahrscheinlich komprimiert) einzulesen und auszuwerten?
Ist das überhaupt möglich?

Wenn ich das File normal einlese bekomme ich keine gescheiten Informationen raus sondern nur irgendwelche Hieroglyphen raus?!


Java:
		 BufferedReader br = new BufferedReader(new FileReader(file));
		 String line = null;
         while((line = br.readLine()) != null) {
             System.out.println(line);                
         }
 
Zuletzt bearbeitet von einem Moderator:
Nen PDF is nunmal keine normale Textdatei. Wie kommst du darauf dass es mit FileReader geht?!

Schau dir mal PDFBox, iText, und wie sie alle heißen an.
 
Nen PDF is nunmal keine normale Textdatei. Wie kommst du darauf dass es mit FileReader geht?!

Schau dir mal PDFBox, iText, und wie sie alle heißen an.

Ist mir klar, dass wenn sie komprimiert ist das nicht geht. Ansonsten wärs ja kein Ding...
Das ist die Frage ob das mit denen besser geht?!? Ob man überhaupt Zeilenweise was auslesen kann? Oder davor erst dekomprimieren muss...

EDIT: Mit iText kein Unterschied

Java:
      tInputStream = new FileInputStream("BWB-BVV.pdf");
      tPdfReader = new PdfReader( tInputStream );
      String tContent = new String( tPdfReader.getPageContent( 1 ) );
      System.out.println( tContent );
 
Zuletzt bearbeitet von einem Moderator:
iText ist v. a. dort stark, wo es darum geht, PDF-Dokumente zu generieren. Zur Darstellung kann man beispielsweise den PDFRenderer verwenden oder ICEPDF, um Text auszulesen und das Dokument zu manipulieren geht Apache FOP. Mit Standardmitteln kann Java zunächst nur wenig mit PDF anfangen.

(Nachträglicher Edit: Ich meinte nicht Apache FOP, sondern PDFBox)
 
Zuletzt bearbeitet:
Ja mit iText bekommst halt nur PlainText raus wenn du den gescheit auswerten kannst, kannst den Link von oben benutzen. Ansonsten musst eine andere libary suchen die dir gescheite Objekte zurück liefert.
 
Du kannst auch mittels iText den Objektbaum im PDF durchgehen. Ist halt bissl aufwendig, aber das wird es mit jeder anderen Lib sicherlich auch.
 
Du kannst auch mittels iText den Objektbaum im PDF durchgehen. Ist halt bissl aufwendig, aber das wird es mit jeder anderen Lib sicherlich auch.

Ah okay wusste ich nicht. Hab jetzt so wie im oben genannten Link gemacht.
String parsen ist halt häßlich wenn sich der Aufbau der Daten mal ändert. Da wäre es wahrscheinlich mit Objekten schon schöner und sicherer.
 

Neue Themen


Zurück
Oben