Frage zu replaceAll und regulären Ausdrücken

Status
Nicht offen für weitere Antworten.

Daniel_L

Bekanntes Mitglied
Hallo,

ich wollte mit der String-Methode "replaceAll()" UBB-Code in HTML-Tags umwandeln. Dazu habe ich aus dieser Anleitung folgenden String übernommen:

Code:
        String dummy;
        dummy = content.replaceAll("/\[f\](.*)\[\/f\]/Usi", "[b]\\1[/b]");
        dummy = dummy.replaceAll("/\[k\](.*)\[\/k\]/Usi", "[i]\\1[/i]");        
        dummy = dummy.replaceAll("/\[u\](.*)\[\/u\]/Usi", "<u>\\1</u>");

Nun gibt der compiler mir eine Fehlermeldung: illegal escape characters, und unterstreicht dabei die \ vor den [. Kann mir jemand weiterhelfen? Ich hab keine Ahnung, wo der Fehler liegen könnte...
 
du musst \\[ schreiben, \\ für \ und [ für [,
\[ wäre sonst ein Zeichen, welches es nicht gibt (im Gegensatz z.B. zu \n oder \t)
 
Danke für die schnelle Hilfe! Die Fehlermeldung ist nun weg, allerdings scheint die Konvertierung nicht zu funktionieren:

Code:
        dummy = content.replaceAll("/\\[f\\](.*)\\[\\/f\\]/Usi", "[b]\\1[/b]");
        dummy = dummy.replaceAll("/\\[k\\](.*)\\[\\/k\\]/Usi", "[i]\\1[/i]");        
        dummy = dummy.replaceAll("/\\[u\\](.*)\\[\\/u\\]/Usi", "<u>\\1</u>");

Nun stehen da aber immer noch [k] im Textfeld, anstatt das der Text mit kursiv wird. Liegt nun der Fehler im regulären Ausdruck? Ich hab den jedoch so 1:1 übernommen, oder verarbeitet Java die Ausdrücke anders?
 
bisschen Mitarbeit wäre hilfreich, etwa erklären, worum es überhaupt geht,
ein Beispielstring wie er vorher aussieht, derzeit nachher aussieht und stattdessen aussehen soll usw.

darf ich mir alles aus dem Link zusammensuchen,
dann darfst du nun auch ein bisschen selber die Verbesserung hier suchen:

Code:
public class Test
{

    public static void main(String[] args)
    {
        String a = "/[b]Text[/b]/Usi";
        System.out.println(a);
        String c = a.replaceAll("/\\[b\\](.*)\\[\\/b\\]/Usi", "[b]\\1[/b]");
        System.out.println(c);
        String d = a.replaceAll("/\\[b\\](.*)\\[\\/b\\]/Usi", "[b]$1[/b]");
        System.out.println(d);
        System.out.println("[b]Text[/b]");
    }
}
dass du immer noch [ k] hast, deutet darauf hin, dass das gesammte repace nicht funktionier, evtl. weil du kein /Usi hast usw,
dann mussst du doch noch deinen Text posten..
 
Also, es geht darum, dass ich Text in einer XML Datei habe. Den Text stelle ich in einem JEditorPane dar, und dieser Text soll formatiert werden. Ein Text könnte bspw. so aussehen:

Der Begriff [k]Alter[/k] wird im Kontext von...
.

Diesen String übergebe ich an eine Klasse, die daraus eine HTML-Seite für den Editor-Pane macht:
Code:
    public String [] getHtmlContent() {
        // create an empty string buffer. this buffer contains the html-string
        // which is being display in the main window's "entry textfield"
        StringBuffer retval = new StringBuffer("");
        // the return value consists of two parts: the first part contains the html string
        // of the main content. the second part consists of the autho information
        String [] complete = new String[2];
        
        // first of all, prepare the header and style information of the main content
        retval.append("<style>\n");
        retval.append("body{font-family:Helvetica,sans-serif;font-size:11px;}\n");
        retval.append("h1{font-weight:normal;font-size:12px;color:#800000;}\n");
        retval.append(".content{padding:3px;}\n");
        retval.append(".links h1{font-size:11px;}\n");
        retval.append(".links ul{color:#0000cc;font-size:9px;}\n");
        retval.append(".links ul a{text-decoration:none;}\n");
        retval.append("</style>\n");
        
        // now start with the html content itself
        retval.append("<html><div class=\"content\">");
        
        // if the entry has a title, add it surrounded by <h1>-tags
        if (!title.isEmpty()) {
            retval.append("<h1>");
            retval.append(title);
            retval.append("</h1>\n");
        }
        
        // now copy the content of the entry to a dummy string. here we convert
        // the format codes into html-tags. the format codes are simplified tags
        // for the user to enable simple format editing
        String dummy;
        dummy = content.replaceAll("/\\[f\\](.*)\\[\\/f\\]/Usi", "[b]\\1[/b]");
        dummy = dummy.replaceAll("/\\[k\\](.*)\\[\\/k\\]/Usi", "[i]\\1[/i]");        
        dummy = dummy.replaceAll("/\\[u\\](.*)\\[\\/u\\]/Usi", "<u>\\1</u>");

        dummy = dummy.replaceAll("/\\[color (.*)\\](.*)\\[\\/color\\]/Usi", "<span color=\"\\1\">\\2</span>");
        // after the conversion is done, append the content to the resulting return string
        retval.append(dummy);
        // and close properly the html tags
        retval.append("</div>\n

</p>\n");
        
        // now look for hyperlinks
        if (hyperlinks.size()>0) {
            // we need a temporary buffer again
            StringBuffer dummylink = new StringBuffer("");
            
            // iterare the child elements of the hyperlinks. these were
            // passed as parameter as a List-type
            Iterator<?> iterator = hyperlinks.iterator();
            // TODO fragen, wie hyperlink aus JEditorPane ausführbar
            while (iterator.hasNext()) {
                // first, copy the element of the list to an own variable
                Element link = (Element) iterator.next();
                // if it's not an empty element, surround it with html-list-tags
                if (!link.getText().isEmpty()) {
                    dummylink.append("[*]<a href=\""+link.getText()+"\">");
                    dummylink.append(link.getText());
                    dummylink.append("</a>\n");
                }
            }
            
            // if there have been hyperlinks, they must be stored in the stringbuffer now
            // so, if the string buffer has content, append it to the resulting return string
            if (dummylink.length()>0) {
                // apply a class attribute to the hyperlinks, so we can have certain styles
                // and formatting for the links as well
                retval.append("<div class=\"links\"><h1>"+resourceMap.getString("HyperlinksHeader")+"</h1>\n<ul>");
                retval.append(dummylink.toString());
                retval.append("[/list]</div>\n");
            }
        }
        
        // close all tags properly
        retval.append("</div>\n</html>");
        
        // and put the first complete string into the return array
        complete[0] = retval.toString();
        
        // reset the temporary string buffer
        retval.setLength(0);

        // append new style information for the next "html-page"
        // these author information are set to the second textpanel in the main window
        retval.append("<style>\n");
        retval.append("body{font-family:Helvetica,sans-serif;font-size:10px;}\n");
        retval.append("</style>\n");
        
        retval.append("<html>");
        
        // if there is no author information, tell this the user
        if (author.isEmpty()) {
            retval.append("[i]"+resourceMap.getString("NoAuthor")+"[/i]");
        }
        else {
            retval.append(author);
        }
        
        // finish everything and...
        retval.append("</html>");
        // ...copy the information to the array
        complete[1] = retval.toString();
        
        return complete;
    }

Ich verwende "UBB"-Code, da ich keine < und > in XML-Dateien speichern kann, diese werden ja automatisch in $#..; (irgendwas) konvertiert. Also speichere ich die Formatangaben im klassischen UBB-Stil und möchte daraus nun HTML-Tags machen.

[k]text[/k] zu text z.B.

Leider hab ich keine Ahnung von regulären Ausdrücken. Daher habe ich mir die Anleitung aus dem Internet rausgesucht und übernommen.

Ich probiere mal deinen Code aus, mal sehen ob das was hilft...
 
> [ k]text[/k] zu text z.B.


dann musst du Abschnitte wie "/Usi" aus dem RegEx rausnehmen
 
Hm, das ganze klappt leider immer noch nicht. Hier ein Textbeispiel:

Nordische Etymologie des Altersbegriffs
Der Begriff "Alt" oder "alt" ist den nordischen sprachen nicht als adjektiv bekannt. Alternativ nutzen diese Sprachen [k]gamall[/k], [k]gammal[/k] oder [k]gammel[/k] haben (Schweden, Dänemark).[br][br](Seite 262)

Die Überschrift "Nordische Etymologie des Altersbegriffs" wird entsprechend der Formatvorgaben dick und rot dargestellt. Wenn ich die Funktion "replace()" die Angaben einzeln ersetze (also [k] durch ), klappt es wunderbar. Aber kompliziertere Ersetzungen, bspw. mit Attributen (color=#123456) oder img-tags lassen sich ja nicht so einfach komvertieren/ersetzen, daher wollt ich gerne mit regulären Ausdrücken arbeiten...
 
tja, was du wolltest ist schon klar, was du für Probleme hast eher nicht,
poste so ein Programm wie meins von 9:54 zw. 10.54 (je nach Sommerzeitanzeige),

dein Riesenprogramm zu analysieren macht vielleicht jemand anders gerne, falls dort überhaupt das Problem zu sehen ist,
ich weniger 😉
 
Erstmal vielen Dank für deine Ausdauer. Das Problem lässt sich - glaube ich - ziemlich exakt lokalisieren. Es sind wohl diese drei Code-Zeilen:
Code:
        String dummy; 
        dummy = content.replaceAll("/\\[f\\](.*)\\[\\/f\\]/Usi", "[b]\\1[/b]"); 
        dummy = dummy.replaceAll("/\\[k\\](.*)\\[\\/k\\]/Usi", "[i]\\1[/i]");        
        dummy = dummy.replaceAll("/\\[u\\](.*)\\[\\/u\\]/Usi", "<u>\\1</u>");
(auch schon ohne "/Usi" ausprobiert).

Ich habe mal folgendes probiert:

Code:
        String a = "/[b]Text[/b]/Usi"; 
        System.out.println(a); 
        String c = a.replaceAll("/\\[b\\](.*)\\[\\/b\\]/Usi", "[b]\\1[/b]"); 
        System.out.println(c); 
        String d = a.replaceAll("/\\[b\\](.*)\\[\\/b\\]/Usi", "[b]$1[/b]"); 
        System.out.println(d); 
        System.out.println("[b]Text[/b]"); 

        System.out.println(content); 
        dummy = content.replaceAll("/\\[k\\](.*)\\[\\/k\\]", "[i]\\1[/i]");        
        System.out.println(dummy);

Das Ergebnis:

/Text/Usi
1
Text
Text
Der Begriff "Alt" oder "alt" ist den nordischen sprachen nicht als adjektiv bekannt. Alternativ nutzen diese Sprachen [k]gamall[/k], [k]gammal[/k] oder [k]gammel[/k] haben (Schweden, Dänemark).[br][br](Seite 262)
Der Begriff "Alt" oder "alt" ist den nordischen sprachen nicht als adjektiv bekannt. Alternativ nutzen diese Sprachen [k]gamall[/k], [k]gammal[/k] oder [k]gammel[/k] haben (Schweden, Dänemark).[br][br](Seite 262)


Wenn ich aber folgendes verwende:

Code:
        String dummy;
        dummy = content.replace("[k]", "[i]");
        dummy = dummy.replace("[/k]", "[/i]");
wird der entsprechende Text wunderbar kursiv formatiert...

Reguläre Ausdrücke sind einfach zu hoch für mich, ich glaube, ich extrahiere die Teile separat und arbeite mit "replace()". ???:L
 
> dummy = content.replaceAll("/\\[k\\](.*)\\[\\/k\\]", "\\1");

->

dummy = content.replaceAll("\\[k\\](.*)\\[\\/k\\]", "$1");

oder vielleicht auch schon

dummy = content.replaceAll("\\[k\\](.*)\\[/k\\]", "$1");
 
Damit kommen wir dem ganzen schon näher. ;-)

Das äußerste [k] sowie [/k] werden konvertiert, die inneren aber bleiben:
Der Begriff "Alt" oder "alt" ist den nordischen sprachen nicht als adjektiv bekannt. Alternativ nutzen diese Sprachen gamall[/k], [k]gammal[/k] oder [k]gammel haben (Schweden, Dänemark).[br][br](Seite 262)

aber wie gesagt, ich bleibe beim einfachen replace(), und parse komplizierte Tags wie <color #123456> einfach manuell und ersetze es dann auch mit replace
 
So, nun die fortgeschrittene Variante: ;-)
Ich habe folgendes:

Code:
dummy = content.replaceAll("\\[color (.*)\\]([^\\[]*)\\[/color\\]", "<span style=\"color:$1\">$2</span>");

Dadurch werden alle
Code:
[color #123456]text[/color] in <span style="color:#123456">text</span>
umgewandelt.

Aber auch hier werden "innere" Tags ausgelassen:
Code:
[color #123456]text[/color] text2 [color #123456]text3[/color]
wird zu
Code:
<span style="color:#123456]text1[/color] text2 [color #123456]text3</span>

Wüsstest du da auch noch einen Rat?
 
innerhalb vom ersten color-Tag hast du wieder einen Ausdruck (.*),
der fast alles vorhandene konsumiert,
das kannst du ebenfalls auf ([^\\[]*) reduzieren (= ein beliebiger Text ohne [)
 
Genial! Läuft alles, und nun hab ich das Prinzip soweit verstanden, dass ich es auf meine restlichen Bedürfnisse anwenden/anpassen kann.

Vielen, vielen Dank!
 
Status
Nicht offen für weitere Antworten.

Zurück
Oben