GraphRAG (EL)
GraphRAG — είναι ένα βελτιωμένο παράδειγμα Retrieval-Augmented Generation (RAG), στο οποίο αντί για την παραδοσιακή αναζήτηση σε διάσπαρτα τμήματα κειμένου (chunks) χρησιμοποιείται ένας γράφος γνώσης (Knowledge Graph, KG)[1]. Η δομή γράφου αναπαριστά ρητά τις συνδέσεις μεταξύ οντοτήτων και την ιεραρχία εννοιών του τομέα, επιτρέποντας στο LLM να εκτελεί πολυβηματική λογική εξαγωγή γνώσης και να διαμορφώνει πιο συνειδητές ως προς το πλαίσιο και ερμηνεύσιμες απαντήσεις[2].
Η προσέγγιση GraphRAG επιδεικνύει σημαντικό πλεονέκτημα έναντι του κλασικού RAG κατά την εργασία με σύνθετα, πολυβηματικά (multi‑hop) ερωτήματα, όπου η απάντηση εξαρτάται από τον συνδυασμό διαφόρων γεγονότων διάσπαρτων σε διαφορετικά έγγραφα[3].
Περιορισμοί του κλασικού RAG και πλεονεκτήματα του γράφου
Ο κλασικός RAG, που βασίζεται στη διανυσματική αναζήτηση σε μη δομημένο κείμενο, αντιμετωπίζει μια σειρά από θεμελιώδεις περιορισμούς οι οποίοι καθίστανται κρίσιμοι σε σύνθετα εταιρικά σενάρια:
- Απουσία δομικών συνδέσεων: Ο παραδοσιακός RAG επεξεργάζεται τα chunks κειμένου ως απομονωμένες μονάδες και δεν βλέπει ρητές συνδέσεις μεταξύ τους. Αυτό τον καθιστά αναποτελεσματικό για multi‑hop ερωτήματα, όπου για την απάντηση είναι απαραίτητο να ακολουθηθεί μια αλυσίδα γεγονότων (Α→Β→Γ), ενώ η αναζήτηση εντοπίζει μόνο τον αρχικό και τον τελικό κρίκο (Α και Γ), παραλείποντας τους ενδιάμεσους[1].
- Σημασιολογική αμφισημία: Σε εξειδικευμένους τομείς (ιατρική, νομική, μηχανική) οι όροι έχουν ειδικές σημασίες. Η διανυσματική αναζήτηση, αντιλαμβανόμενη το γενικό θέμα, μπορεί να ερμηνεύσει εσφαλμένα τον ρόλο ενός συγκεκριμένου αντικειμένου, οδηγώντας στην εξαγωγή μη σχετικού πλαισίου.
- Περιορισμένη ερμηνευσιμότητα: Ο κλασικός RAG παρέχει τμήματα εγγράφων, αλλά όχι ρητές αποδείξεις για το πώς αυτά τα τμήματα συνδέονται σε μια λογική αλυσίδα. Το GraphRAG, αντίθετα, καθιστά αυτή τη διαδικασία διαφανή, παρέχοντας ως απόδειξη το μονοπάτι στον γράφο και απαιτώντας σύνδεση των ισχυρισμών με πηγές (παραπομπές)[4].
Το GraphRAG επιλύει αυτά τα προβλήματα αναπαριστώντας τη γνώση ως δίκτυο συνδεδεμένων οντοτήτων και σχέσεων, επιτρέποντας στο σύστημα όχι απλώς να εντοπίζει παρόμοιο κείμενο, αλλά να εκτελεί λογική συναγωγή βάσει ενός τυποποιημένου μοντέλου του γνωστικού πεδίου.
Αρχιτεκτονική GraphRAG
Ο γενικός αγωγός (pipeline) GraphRAG επεκτείνει τον κλασικό RAG προσθέτοντας στάδια κατασκευής και χρήσης του γράφου γνώσης. Διαιρείται σε δύο κύρια στάδια: εκτός σύνδεσης (offline) προετοιμασία και επεξεργασία ερωτήματος σε πραγματικό χρόνο (online).
Στάδιο 1: Εισαγωγή και ευρετηρίαση (offline)
Σε αυτό το στάδιο, τα αρχικά δεδομένα (έγγραφα, βάσεις δεδομένων) μετατρέπονται σε δύο συμπληρωματικές αναπαραστάσεις: γραφική και διανυσματική.
- Εξαγωγή γνώσης: Από τα κείμενα εξάγονται δομημένα γεγονότα μέσω ενός αγωγού NLP:
- Named Entity Recognition (NER): Εντοπισμός αναφορών οντοτήτων (ανθρώπων, οργανισμών, προϊόντων).
- Entity Linking (EL): Σύνδεση αναφορών με κανονικά αναγνωριστικά στον γράφο για την άρση αμφισημίας (π.χ. «Ιωάννης Παπαδόπουλος» και «Ι. Παπαδόπουλος» γίνονται ένας κόμβος)[5].
- Relation Extraction (RE): Ανίχνευση σχέσεων μεταξύ οντοτήτων (π.χ. Εταιρεία Χ −εξαγόρασε→ Startup Y).
- Μοντελοποίηση και αποθήκευση γράφου: Τα εξαχθέντα τριπλέτα (υποκείμενο‑κατηγόρημα‑αντικείμενο) φορτώνονται σε μια βάση δεδομένων γράφου. Η επιλογή μοντέλου (Property Graph ή RDF) εξαρτάται από την εργασία. Είναι κρίσιμης σημασίας η αποθήκευση της προέλευσης (provenance) κάθε γεγονότος — παραπομπή στο αρχικό έγγραφο και στο τμήμα κειμένου[3]. Στον γράφο μπορούν επίσης να προστεθούν μεταδεδομένα για χρόνο (valid_from/valid_to) και αξιοπιστία (confidence).
- Υβριδική ευρετηρίαση: Παράλληλα με τον γράφο, δημιουργείται ένα διανυσματικό ευρετήριο για τα αρχικά τμήματα κειμένου. Αυτό επιτρέπει τον συνδυασμό δομικής αναζήτησης στον γράφο με σημασιολογική αναζήτηση στο κείμενο.
Στάδιο 2: Επεξεργασία ερωτήματος και παραγωγή απάντησης (online)
- Ανάλυση ερωτήματος: Το ερώτημα του χρήστη αναλύεται για την εξαγωγή βασικών οντοτήτων, οι οποίες χρησιμεύουν ως «σημεία εισόδου» στον γράφο.
- Εξαγωγή υπογράφου: Αντί για αναζήτηση μεμονωμένων chunks, το GraphRAG εντοπίζει έναν σχετικό υπογράφο — ένα συνδεδεμένο τμήμα του γράφου γύρω από τα «σημεία εισόδου», που περιέχει πληροφορίες για την απάντηση. Για αυτό χρησιμοποιούνται αλγόριθμοι όπως η διέλευση k‑hop ή το Personalized PageRank (PPR)[6].
- Υβριδική αναζήτηση και συγχώνευση αποτελεσμάτων: Παράλληλα με την εξαγωγή υπογράφου, εκτελείται αναζήτηση στο διανυσματικό ή/και λεξιλογικό (BM25) ευρετήριο. Τα αποτελέσματα από τον γράφο και το κείμενο συγχωνεύονται και μεταβιβάζονται στο επόμενο στάδιο.
- Επαναταξινόμηση (Re‑ranking): Η συγχωνευμένη λίστα υποψηφίων (κόμβοι γράφου και chunks κειμένου) επαναταξινομείται με τη βοήθεια ενός πιο ακριβούς μοντέλου (π.χ. cross-encoder) για την επιλογή της πιο σχετικής πληροφορίας. Αυτό επιτρέπει το φιλτράρισμα θορύβου και τη βελτίωση της ακρίβειας[7].
- Συσκευασία πλαισίου και παραγωγή: Το επιλεγμένο και επαναταξινομημένο πλαίσιο (υπογράφος και κείμενα) μετατρέπεται σε κατανοητή μορφή για το LLM (π.χ. λίστα ισχυρισμών με αναφορά πηγών). Αυτό το εμπλουτισμένο πλαίσιο τροφοδοτείται στο prompt για την παραγωγή της τελικής απάντησης.
- Ιχνηλάτηση και παραπομπές: Χάρη στη σύνδεση «γεγονός ↔ πηγή» στον γράφο, η παραγόμενη απάντηση περιέχει ακριβείς παραπομπές στα έγγραφα που επιβεβαιώνουν κάθε θέση. Αυτό εξασφαλίζει υψηλή αιτιολόγηση και διαφάνεια.
Συγκριτικός πίνακας συνιστωσών
| Συνιστώσα/πτυχή | Παραλλαγές υλοποίησης | Πλεονεκτήματα | Μειονεκτήματα/κίνδυνοι | Πότε προτιμάται |
|---|---|---|---|---|
| Μοντέλο γράφου γνώσης | RDF/OWL | Αυστηρή οντολογία, λογική συναγωγή (reasoning), συμβατότητα με Linked Open Data. | Δύσκολη αποθήκευση ιδιοτήτων σχέσεων (χρόνος, πηγή) χωρίς πρόσθετες οντότητες (reification). | Σημασιολογικά πλούσιοι τομείς με υπάρχουσες οντολογίες· απαιτείται παραγωγή συμπερασμάτων. |
| Property Graph (Neo4j, κ.λπ.) | Ευελιξία, αυθαίρετες ιδιότητες σε κόμβους/ακμές, υψηλή απόδοση. | Απαιτεί σαφές σχήμα χειροκίνητα ή κίνδυνος «αταξίας»· δεν υπάρχει ενιαίο πρότυπο. | Γρήγορη εκκίνηση με μη δομημένα δεδομένα· ενσωμάτωση με έγγραφα (multi‑model DB). | |
| Εξαγωγή υπογράφου | k‑hop BFS / DFS | Καλύπτει όλους τους κόμβους μέχρι βάθος k, απλή υλοποίηση. | «Έκρηξη» γράφου: εκθετική αύξηση αριθμού κόμβων· μπορεί να επιστρέψει πολύ θόρυβο. | Μικροί γράφοι ή διέλευση σε βάθος 1–2· ιεραρχικές δομές. |
| Personalized PageRank (PPR) | Εστιάζει σε πραγματικά συνδεδεμένους κόμβους, ο θόρυβος φιλτράρεται[6]. | Μπορεί να παραλείψει έναν απομακρυσμένο αλλά σημαντικό κόμβο (αν υπάρχουν λίγα μονοπάτια αλλά είναι κρίσιμος). | Σύνθετα δίκτυα με πολλά μονοπάτια (κοινωνικός γράφος, γράφος παραπομπών). | |
| Υβριδική αναζήτηση | Συνδυαστική λίστα (scalar fusion με βάρος λ) | Η ρύθμιση βαρών λ επιτρέπει ισορρόπηση precision/recall ανά εργασία[8]. | Το σταθερό λ δεν είναι βέλτιστο για όλους τους τύπους ερωτημάτων. | Στο στάδιο πρωτοτυποποίησης· όταν είναι γνωστό ότι μία πηγή είναι εκ των προτέρων σημαντικότερη. |
| Cross‑encoder rerank | Σημαντική αύξηση ακρίβειας· δυνατότητα λήψης υπόψη σύνθετων αλληλεπιδράσεων. | Αυξάνει την καθυστέρηση· απαιτεί δεδομένα εκπαίδευσης ή χρήση έτοιμων μοντέλων[7]. | Σενάρια high‑precision (νομική, ιατρική), όπου είναι σημαντικό το μέγιστα σχετικό πλαίσιο. | |
| Ασφάλεια δεδομένων | Φιλτράρισμα υπογράφου (RBAC/ABAC) | Λεπτομερής έλεγχος (μέχρι επίπεδο κόμβου) αποκλείει διαρροές. | «Τυφλά σημεία»: αν αφαιρεθεί σημαντικός κόμβος, η απάντηση μπορεί να είναι ελλιπής. | Σε εταιρικά περιβάλλοντα με αυστηρές απαιτήσεις πρόσβασης (PII, GDPR, εμπορικά μυστικά). |
Ιχνηλάτηση, εμπιστοσύνη και ασφάλεια
Ένα από τα κύρια πλεονεκτήματα του GraphRAG είναι η δυνατότητα παρουσίασης διαφανών αλυσίδων αποδείξεων. Αντί για απάντηση «μαύρου κουτιού», το σύστημα μπορεί να δείξει το μονοπάτι συλλογισμού: «Το γεγονός Α αναφέρεται στο [doc1]. Συνδέεται με το γεγονός Β [doc2], και το Β σύμφωνα με το [doc3] οδηγεί στο Γ» — κάτι που αυξάνει την εμπιστοσύνη του χρήστη και απλοποιεί τον εντοπισμό σφαλμάτων.
Επιπλέον, η δομή γράφου επιτρέπει την υλοποίηση λεπτομερούς ελέγχου πρόσβασης (RBAC/ABAC). Κάθε κόμβος ή ακμή στον γράφο μπορεί να έχει ετικέτα πρόσβασης. Κατά την εξαγωγή του υπογράφου, το σύστημα φιλτράρει αυτόματα τα δεδομένα στα οποία ο χρήστης δεν έχει δικαιώματα, εξασφαλίζοντας ασφάλεια σε ευαίσθητους τομείς (οικονομικά, HR, ιατρική).
Αξιολόγηση ποιότητας
Η αξιολόγηση ενός συστήματος GraphRAG είναι πολυσταδιακή και περιλαμβάνει μετρικές για κάθε συνιστώσα:
- Μετρικές εξαγωγής γνώσης: F1‑score για NER και RE, ώστε να αξιολογηθεί η ποιότητα κατασκευής του γράφου.
- Μετρικές εξαγωγής υπογράφου: Subgraph Recall@K (ποσοστό περιπτώσεων στις οποίες οι κόμβοι/ακμές που απαιτούνται για την απάντηση συμπεριλήφθηκαν στον εξαχθέντα υπογράφο) και Path Precision/Recall για ερωτήματα multi‑hop.
- Μετρικές απάντησης LLM:
- Faithfulness / Groundedness: σε ποιον βαθμό η απάντηση βασίζεται αυστηρά στο παρεχόμενο πλαίσιο.
- Human evaluation: αξιολόγηση από εμπειρογνώμονες βάσει κριτηρίων ορθότητας, πληρότητας και συνοχής.
Για την αυτοματοποίηση της αξιολόγησης χρησιμοποιούνται εξειδικευμένα benchmarks (π.χ. WebQuestionsSP, GrailQA) και frameworks (π.χ. RAGAS)[9].
Δείτε επίσης
- Retrieval‑Augmented Generation (RAG)
- Γράφος γνώσης
- Διανυσματική βάση δεδομένων
- Embedding
- AI-πράκτορας
- Αξιολόγηση και benchmarks LLM
Βιβλιογραφία
- Zhang, Q. et al. (2025). A Survey of Graph Retrieval‑Augmented Generation for Customized Large Language Models. arXiv:2501.13958.
- Xu, Z. et al. (2024). Retrieval‑Augmented Generation with Knowledge Graphs for Customer Service Question Answering. arXiv:2404.17723.
- Hu, Y. et al. (2024). GRAG: Graph Retrieval‑Augmented Generation. arXiv:2405.16506.
- Nakano, R. et al. (2021). WebGPT: Browser‑assisted Question‑Answering with Human Feedback. arXiv:2112.09332.
- Yang, R. et al. (2025). KG‑IRAG: A Knowledge Graph‑Based Iterative Retrieval‑Augmented Generation Framework for Temporal Reasoning. arXiv:2503.14234.
- Song, Y. et al. (2023). Advancements in Complex Knowledge Graph Question Answering: A Survey. DOI:10.3390/electronics12214395.
- Nogueira, R.; Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
- Hsu, H.‑L.; Tzeng, J. (2025). DAT: Dynamic Alpha Tuning for Hybrid Retrieval in Retrieval‑Augmented Generation. arXiv:2503.23013.
- Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. arXiv:2005.11401.
- Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain Question Answering. arXiv:2004.04906.
- Sun, H. et al. (2018). Open‑Domain Question Answering Using Early Fusion of Knowledge Bases and Text (GRAFT‑Net). arXiv:1809.00782.
- Sun, H.; Bedrax‑Weiss, T.; Cohen, W. W. (2019). PullNet: Open‑Domain Question Answering with Iterative Retrieval on Knowledge Bases and Text. arXiv:1904.09537.
- He, X. et al. (2024). G‑Retriever: Retrieval‑Augmented Generation for Textual Graph Understanding and Question Answering. arXiv:2402.07630.
- Es, S.; James, J.; Espinosa‑Anke, L.; Schockaert, S. (2024). RAGAs: Automated Evaluation of Retrieval Augmented Generation. ACL:2024.eacl-demo.16.
Παραπομπές
- ↑ 1.0 1.1 Zhang, Q., et al. A Survey of Graph Retrieval-Augmented Generation for Customized Large Language Models. arXiv, 2025. arXiv:2501.13958.
- ↑ Xu, Z., et al. Retrieval-Augmented Generation with Knowledge Graphs for Customer Service Question Answering. SIGIR, 2024. arXiv:2404.17723; DOI: 10.1145/3626772.3661370.
- ↑ 3.0 3.1 Hu, Y., et al. GRAG: Graph Retrieval‑Augmented Generation. arXiv, 2024. arXiv:2405.16506; также в Findings of NAACL 2025: ACL Anthology.
- ↑ Nakano, R., et al. WebGPT: Browser‑assisted question‑answering with human feedback. arXiv, 2021. arXiv:2112.09332.
- ↑ Yang, R., et al. KG‑IRAG: A Knowledge Graph‑Based Iterative Retrieval‑Augmented Generation Framework for Temporal Reasoning. arXiv, 2025. arXiv:2503.14234.
- ↑ 6.0 6.1 Song, Y., Li, W., Dai, G., Shang, X. Advancements in Complex Knowledge Graph Question Answering: A Survey. Electronics, 2023. DOI: 10.3390/electronics12214395.
- ↑ 7.0 7.1 Nogueira, R., Cho, K. Passage Re‑ranking with BERT. arXiv, 2019. arXiv:1901.04085.
- ↑ Hsu, H.‑L.; Tzeng, J. DAT: Dynamic Alpha Tuning for Hybrid Retrieval in Retrieval‑Augmented Generation. arXiv, 2025. arXiv:2503.23013.
- ↑ Es, S.; James, J.; Espinosa Anke, L.; Schockaert, S. RAGAs: Automated Evaluation of Retrieval Augmented Generation. EACL (System Demonstrations), 2024. ACL:2024.eacl-demo.16; также preprint: arXiv:2309.15217.