Zufallsauswahl aus ResultList bei JPA(Hibernate) / Performance

JanHH

Top Contributor
Hallo,

folgende Problemstellung: Eine simple JPA-Query liefert eine ResultList, unter Umständen eine recht lange (mehrere 10.000 Einträge). Nun soll aus dieser Liste eins (oder auch mal mehrere) Elemente zufällig ausgewählt werden.

Wie macht man das richtig, wie verhält sich das performancetechnisch?

Ich kann ja problemlos die Länge der Liste in Erfahrung bringen, dann eine Zufallszahl erzeugen (welche niedriger als die Länge der Liste ist), und mit list.get(zufallszahl) auf ein Element zufällig zugreifen. Aber was passiert da intern?

Mir wurde mal erzählt, die Liste bzw. ihr Iterator ist in Wirklichkeit ein Pointer auf das entsprechende ResultSet innerhalb der Datenbank, und erst wenn man auf die Objekte zugreift, werden sie tatsächlich aus der Datenbank geladen. Stimmt das? Also wenn ich bspws. sage: list.get(10000), werden dann a) alle Objekte aus der Liste aus der Datenbank geladen und dann auf das 10.000te zugegriffen (was langsam sein dürften), b) alle Objekte bis zum 10.000ten gelanden, c) nur das 10.000te geladen?

Also wenn ich nun, sagen wir mal, 50 zufällige Objekte aus einer 20.000 Einträge langen Liste haben will, wie macht man das optimalerweise, so dass die performance nicht den Bach runter geht?

Gruß+Danke
Jan
 
Zuletzt bearbeitet:
ResultList finde ich bei google nicht, ResultSet dagegen schon,
oder erhältst du irgendwo eine java.util.List als Rückgabe? so kenne ich es bei Hibernate

ich kann mir nicht vorstellen, das es dort einen Index-Zugriff gibt (ResultSet) oder irgendeine Art Durchlaufen,
bei dem letzlich nicht alle Objekte aus der DB geladen werden, aber sicher bin ich mir da längst nicht

zwei Alternativen:
1. lade nur 50 Elemente aus der DB, setzte also maxResults, wie immer das bei deiner DB oder deinem Java-Framework funktioniert,
vorher noch die Ergebnisse zufällig sortien, also mischen, wiederum 'wie immer das auch geht', order by rand() habe ich im Ohr, aber vielleicht DB-abhängig,

im äußersten Notfall eine zusätzliche Spalte einfügen und die irgendwann mal mit Zufallszahlen besetzen,
allzu variabel ist das dann nicht für mehrere Queries, vielleicht helfen dafür Berechnungen:
[c]order by (randAttribut * x) modulo y[/c] mit zufälligen x/y pro Query

2. lade nur die Ids oder sonstwas kleines, so dass es nicht mehr belastend ist, alle 20.000 Einträge direkt in Java vorliegen zu haben,
da dann auf beliebige Weise 50 auswählen und nur diese komplett nachladen
 
Zuletzt bearbeitet von einem Moderator:
Query q=entityManager.createQuery();
List l=q.getResultList();

gibt in der Tat eine List zurück.

Naja ich denk ich werd die Performance bei 10.000 Einträgen einfach mal Testen..
 
Für meine Anwendung scheint folgende Variante optimal:

- schon beim Anlegen der Daten in der Datenbank pro Zeile eine eindeutige Zufallszahl vergeben (b.random)
- bei der query dann "order by b.random" und setMaxResults()

geht bei 13.000 Zeilen zumindest ruckzuck.

Danke
Jan
 

Neue Themen


Zurück
Oben