Collections Text-Dateien auf Gleichheit überprüfen

  • Themenstarter Themenstarter Rose Asbenhe
  • Beginndatum Beginndatum
R

Rose Asbenhe

Gast
Hey zusammen!

Auch ich hab von der Uni mal wieder ne neue tolle Aufgabe bekommen und probier und lösch seit 3 Stunden unzählige Ideen 😉

Grob zusammengefasst geht es darum, dass ich als Kommandozeilenargumente zwei Dateien überreiche (ist ja weiter kein Problem). Die eine Datei ist so ein Miniwörterbuch und die andere Datei einfach eine Text-Datei. Ausgedruckt werden sollen alle Wörter aus der Text-Datei, die nicht im Wörterbuch vorkommen.

sooo und jetzt kommt meine supertolle Frage:
wie wandel ich die Text-Dateien in Strings um? Oder muss ich das überhaupt nicht tun? Bei einer anderen Aufgabe vor ein paar Wochen mussten wir Bilddateien bearbeiten. Da war es irgendwas mit Streams.. aber.. keine Ahnung, ob das da auch geht.

Vielen lieben Dank schonmal!
 
Google sollte doch bei "java read text file" genügen fertige Lösungen liefern.
Zuerst solltest du das Wörterbuch einlesen und eine Wortliste erstellen. Dannach Text einlesen, nach Wörtern splitten und prüfen.
 
Haja, also danke erstmal - bei BufferedReader hat's erstmal geklingelt und googlen hat auch viel gebracht. Wollte das jetzt schön runterschreiben und dann stolz berichten, dass es geklappt hat. Aber inzwischen sehe ich wortwörtlich nur noch rot 😉

An sich hat es relativ schnell geklappt, die Dateien zu lesen. Nur bei split ging's nicht mehr.

ach ich zeig mal schnell was ich habe:

Java:
    try{
        FileInputStream text = new FileInputStream(args[0]);
        DataInputStream data = new DataInputStream(text);
        BufferedReader buffer = new BufferedReader(new InputStreamReader(data));
        String[] ausgabe;
        while ((ausgabe= = buffer.readLine().split(".")) != null)   {
        	
          System.out.println (ausgabe);
        }
        data.close();
        }catch (Exception e){
          System.err.println(e);
        }
      }
}

(ja das Datazeugs ist aus dem Internet geklaut, aber irgendwo muss ich das Zeug zum rumprobieren ja herbekommen 🙂 )
zum Splitten hatte ich erst:

Java:
        String[] ausgabe = buffer.readLine().split(".");
        while (ausgabe != null)

war natürlich nix 🙁

(ich hatte noch einige, einige andere Versuche, seit euren Antworten bin ich am Testen - aber ich poste aus Platzgründen lieber nur einen)
 
Geht ein Schritt zurück und lass dir die Datei einfach Zeilenweise ausgeben. Die jetztige while-Bedingung macht kein Sinn
 
zeilenweise auslesen *google*

okay, danke! ist die while-schleife überhaupt angebracht? oder lieber eine for? ach, ne, dann müsste ich ja vorher wissen, wie lang der Text ist oder?
 
man.. ist das alles frustrierend 🙁

ich habe jetzt immerhin schonmal das überflüssige zeugs rausbekommen und bin mittlerweile hier:
Java:
	  public static void main (String[] args) {
		  
		   String[] zeile;			   
		   for (int i=0; i < args.length; i++) {		 
		     
		     try {
		       BufferedReader buffer = new BufferedReader(new FileReader(args[i]));
		       while ((zeile = buffer.readLine().split("\\s")) != null) {
		         System.out.println(zeile);
		       }  
		     }
		     catch (IOException e) {
			      e.printStackTrace();
		     }
		  } 		  
		}

(weil ich ja zwei Dateien eingeben soll - keine Ahnung ob das so Sinn ergibt, gleich beide auf einmal zu machen, wenn ich sie dann vergleichen soll)
wie ihr sehen könnt, hänge ich weiterhin am splitten. Ohne das lässt sich der Text wunderschön ausdrucken, nur mit bekomm ich eine Liste, wie:
[Ljava.lang.String;@3e25a5
[Ljava.lang.String;@19821f
[Ljava.lang.String;@addbf1
[Ljava.lang.String;@42e816
[Ljava.lang.String;@9304b1
Exception in thread "main" java.lang.NullPointerException
at SpellChecker.main(SpellChecker.java:28)

funktioniert das denn überhaupt so? Ich will mir die Dateien ja eigtl. gar nicht anschauen, sondern im Endeffekt dann nur vergleichen.
--

eine Kommilitonen, die es schon hat, meinte, sie hätte es mit RandomAccessFile gemacht und funktioniert wunderbar.

Danke danke an jeden kleinen Tipp ! 🙂
 
Java:
	  public static void main (String[] args) {		 
		     
		     try {
		       BufferedReader buffer = new BufferedReader(new FileReader(args[0]));
		       String zeile;
		       while ((zeile = buffer.readLine()) != null) {
		         System.out.println(zeile);
		       }  
		     }
		     catch (IOException e) {
			      e.printStackTrace();

so druckts mir den Text schon schön aus, jetzt ein neues String-Array, mit dem ich "zeile" bei Leerzeichen trenne?
 
Naiverweise wollte ich jetzt

String[] aufgeteilt = zeile.split("\\.");

schreiben. Ich probier's lieber gar nicht erst, oder? 😀

brauch ich irgendwas mit Pattern ? Oder/und noch andere Schleifen?
 
Java:
		     try {
		       BufferedReader buffer = new BufferedReader(new FileReader(args[1]));
		       String textzeile;
		       while ((textzeile = buffer.readLine()) != null) {
		    	   Pattern p1 = Pattern.compile("\\s");
		    	   String[] s1 = p1.split(textzeile);
		    	   for (int i = 0; i < s1.length; i++)
		    	   {
		    	       System.out.println(s1[i]);
		    	   }
		    	           
		       }  
		     }
		     catch (IOException e) {
			      e.printStackTrace();
		     }
		  }

es geht, es geht, es geht, es geeeeeeeeeeeeeeeeeeeeeht 🙂 🙂
Aber wie sage ich dem Ding nu, dass er bei Punkten, Kommas und einfach allen sonstigem Zeug, auch noch splittet? habe es mit Pattern p1 = Pattern.compile("\\s\\w"); probiert, aber das mag er nicht so.

(Und wenn wir gerade schon dabei sind. Jeder einzelne Großbuchstabe soll noch verkleinert werden. nur, damit ihr Bescheid wisst 😉)
 
Java:
		     try {
			       BufferedReader buffer = new BufferedReader(new FileReader(args[0]));
			       String testzeile;
			       while ((testzeile = buffer.readLine()) != null) {
			    	   testzeile = testzeile.replaceAll("\\p{Punct}", "");
			    	   testzeile = testzeile.toLowerCase();
			    	System.out.println(testzeile);}  
			     
		       BufferedReader buffer1 = new BufferedReader(new FileReader(args[1]));
		       String textzeile;
		       while ((textzeile = buffer1.readLine()) != null) {
		    	   textzeile = textzeile.replaceAll("\\p{Punct}", "");
		    	   textzeile = textzeile.toLowerCase();
		    	   Pattern p1 = Pattern.compile("\\s");
		    	   String[] s1 = p1.split(textzeile);
		    	   for (int i = 0; i < s1.length; i++)System.out.println(s1[i]);		    	   		    	    
		       }  
		     }
		     catch (IOException e) {
			      e.printStackTrace();
		     }
		  }

es wird ja 🙂 ich wurde allerdings gerade darauf hingewiesen, dass die Wörter ja wieder ausgespuckt werden sollen. Also die, die in der vorgegeben Wörterbuch-Datei nicht drinnen stehen. Und wenn in der Text-Datei Wörter groß geschrieben sind, dann sollen die auch groß wieder rauskommen. Habe ich das jetzt schon mit toLowerCase() zerstört?

(danke danke danke, alleine wäre ich nie so weit gekommen !)
 
was soll denn
Code:
\\p{Punct}
sein? oO
Ja, mit toLowerCase hast du es zerstört.
Aber du hast mal wieder 1000 Schritte übersprungen. Zunächst solltest du die Wörter genünftig splitten. Dann solltest du dir ne Liste von Wörtern, z.B. ArrayList<String> anlegen und die Wörter aus dem Wörterbuch da eintragen.
 
\\p{Punct} steht in unserem Skript - sind alle Punktzeichen, funktioniert einwandfrei =D

immernoch nicht richtig gesplittet ? oh man 🙁 bis jetzt habe ich bei einer Textdatei mit dem Inhalt .. ääh..

Hallo, das soll jetzt die Textdatei darstellen. Ist sie nicht schön?

die Ausgabe:
hallo
das
soll
jetzt
.
.
.
schön

---

aber ich finde die ArrayListe gerade spannender 🙂
brauch ich hier nu irgendwas Generisches?

Liste erstellen ist klar,
ArrayList<String> array = new ArrayList<String>();
(ja ich bin bei der Namensgebung das Variablen immer sehr kreativ .. 😀)

dann eine for-Schleife mit (a b:c) (also irgendwas) und eine array.add-Methode ?
 
Du hast doch schon eine Schleife, warum willst du eine neue?
Jetzt musst du die Wörter nicht auf die Konsole ausgeben, sondern in diese Liste speichern (am besten alles kleingeschrieben).

Und erst dann kannst du anfangen mit der 2. Datei zu arbeiten. Die Schritte verkürze ich mal:
Code:
- 2. Datei zeilenweise einlesen
- splitten
- für jedes Wort in der Zeile
- - wenn es nicht in deiner Wörterbuchliste existiert, dann ausgeben
 
achso ja stimmt. Ich glaub... ich geh erstmal schlafen 😉 Und morgen früh nach dem Aufstehen geht's dann topmotiviert (...) weiter 😉

Also ich rühr mich ganz bestimmt wieder, spätestens mit einem Freudentanz, wenn es funktioniert 🙂

Gute Naaacht
 
Soo.. ich war mal wieder ziemlich fleißig heute und habs nochmal komplett von vorne angefangen. Mittlerweile bin ich hier angekommen:

Java:
mport java.io.BufferedReader;
import java.io.FileReader;
import java.io.IOException;
import java.util.ArrayList;


public class SpellChecker{
	
	static ArrayList<String> textdatei = new ArrayList<String>();	
	
	public static void main(String[] args){
		
		try{
			ArrayList<String> woerterbuch = new ArrayList<String>();
			BufferedReader buffer = new BufferedReader(new FileReader(args[0]));
			String zeile = null;
			while ((zeile = buffer.readLine()) != null) {
				woerterbuch.add(zeile.toLowerCase());
		}
			buffer.close();
								
			BufferedReader buffer1 = new BufferedReader(new FileReader(args[1]));
			while((zeile = buffer1.readLine())!=null){
				if(zeile != null){
					String[] fehlendeWoerter = zeile.replaceAll("\\p{Punct}"," ").split("\\s");
					for(String input:fehlendeWoerter){
						System.out.println("Diese Wörter werden gerade überprüft: " + input);
						try{
							Integer.parseInt(input);
						}catch(NumberFormatException e){
							if(!woerterbuch.contains(input.toLowerCase())){
								textdatei.add(input);
							}
						}
					}
				}
			}
			buffer1.close();
		
			
			
		}
		catch(IOException e){
			e.printStackTrace();
		}
		System.out.println("Diese Wörter haben sich herauskristallisiert: " + textdatei.toString());
	}
}

Die Ausgabe funktioniert noch nicht gaaanz so richtig, fällt euch was auf?
Danke 🙂
 

Zurück
Oben