Bilgi Grafı Kullanan RAG
GraphRAG — Retrieval-Augmented Generation (RAG) paradigmasının geliştirilmiş bir biçimidir; bu yaklaşımda geleneksel dağınık metin parçaları (chunk) üzerinde arama yerine bir bilgi grafı (Knowledge Graph, KG) kullanılır[1]. Grafik yapısı, varlıklar arasındaki ilişkileri ve alan kavramlarının hiyerarşisini açıkça temsil eder; bu sayede LLM çok adımlı mantıksal bilgi çıkarımı gerçekleştirebilir ve bağlama daha duyarlı, daha açıklanabilir yanıtlar üretebilir[2].
GraphRAG yaklaşımı, birden fazla belgede dağınık hâlde bulunan çeşitli gerçeklerin bir kombinasyonuna bağlı olan karmaşık, çok adımlı (multi‑hop) sorgularda klasik RAG'e kıyasla belirgin bir üstünlük sergilemektedir[3].
Klasik RAG'ın Sınırlılıkları ve Grafın Avantajları
Yapılandırılmamış metin üzerinde vektör aramasına dayanan klasik RAG, karmaşık kurumsal senaryolarda kritik hâle gelen bir dizi temel sınırlılıkla karşı karşıyadır:
- Yapısal ilişkilerin yokluğu: Geleneksel RAG, metin chunk'larını yalıtılmış birimler olarak işler ve aralarındaki açık ilişkileri göremez. Bu durum, yanıt üretmek için bir olgular zinciri üzerinden ilerlenmesi gereken (A→B→C) multi‑hop sorgularda yöntemin verimsiz kalmasına yol açar; arama yalnızca başlangıç ve bitiş halkalarını (A ve C) bulurken aradaki halkaları gözden kaçırır[1].
- Anlamsal belirsizlik: Dar uzmanlaşmış alanlarda (tıp, hukuk, mühendislik) terimler özgül anlamlar taşır. Vektör araması genel konuyu yakalasa da belirli bir nesnenin rolünü yanlış yorumlayabilir ve bu durum ilgisiz bağlamın getirilmesine neden olabilir.
- Sınırlı açıklanabilirlik: Klasik RAG belge parçaları sunar; ancak bu parçaların mantıksal bir zincir biçiminde nasıl ilişkilendirildiğine dair açık kanıtlar sağlamaz. GraphRAG ise bu süreci şeffaf kılar: kanıt olarak grafikteki yolu sunar ve ifadelerin kaynaklara bağlanmasını (alıntılama) zorunlu kılar[4].
GraphRAG, bilgiyi birbirine bağlı varlıklar ve ilişkilerden oluşan bir ağ olarak temsil ederek bu sorunları çözer; böylece sistem yalnızca benzer metin bulmakla kalmaz, aynı zamanda alanın resmîleştirilmiş modeline dayalı mantıksal çıkarım yapabilir.
GraphRAG Mimarisi
GraphRAG'ın genel ardışık düzeni (pipeline), klasik RAG'ı bilgi grafının oluşturulması ve kullanılması aşamalarıyla genişletir. İki temel aşamaya ayrılır: çevrimdışı hazırlık ve çevrimiçi sorgu işleme.
Aşama 1: Veri Alımı ve İndeksleme (Çevrimdışı)
Bu aşamada ham veriler (belgeler, veritabanları) birbirini tamamlayan iki temsile dönüştürülür: grafik tabanlı ve vektör tabanlı.
- Bilgi çıkarımı: Metinlerden NLP ardışık düzeni aracılığıyla yapılandırılmış olgular elde edilir:
- Named Entity Recognition (NER): Varlık ifadelerinin (kişiler, kuruluşlar, ürünler) bulunması.
- Entity Linking (EL): Belirsizliği gidermek için ifadelerin grafikteki standart tanımlayıcılara bağlanması (örneğin, "Ahmet Y." ve "A. Yılmaz" aynı düğüm hâline gelir)[5].
- Relation Extraction (RE): Varlıklar arasındaki ilişkilerin belirlenmesi (örneğin, Şirket X −satın aldı→ Girişim Y).
- Grafik modelleme ve depolama: Çıkarılan üçlüler (özne‑yüklem‑nesne) bir grafik veritabanına yüklenir. Model seçimi (Property Graph veya RDF) göreve göre belirlenir. Her olgunun kökeni (provenance) — kaynak belgeye ve metin parçasına yapılan atıf — depolamak kritik önem taşır[3]. Grafiğe ayrıca zaman (valid_from/valid_to) ve güvenilirlik (confidence) üst verileri de eklenebilir.
- Hibrit indeksleme: Grafıkle eş zamanlı olarak kaynak metin parçaları için bir vektör indeksi oluşturulur. Bu sayede grafikte yapısal arama ile metinde anlamsal arama bir arada kullanılabilir.
Aşama 2: Sorgu İşleme ve Yanıt Üretimi (Çevrimiçi)
- Sorgu ayrıştırma: Kullanıcı sorgusu, grafiğe "giriş noktaları" olarak hizmet eden anahtar varlıkları belirlemek amacıyla çözümlenir.
- Alt grafik çıkarımı: Ayrı chunk'lar aramak yerine GraphRAG, "giriş noktaları" çevresinde yanıt için gereken bilgiyi barındıran bağlı bir grafik parçası olan ilgili alt grafı bulur. Bunun için k‑hop dolaşımı veya Personalized PageRank (PPR) gibi algoritmalar kullanılır[6].
- Hibrit arama ve sonuçların birleştirilmesi: Alt grafik çıkarımıyla eş zamanlı olarak vektör ve/veya sözcüksel (BM25) indeks üzerinde arama yapılır. Grafik ve metinden gelen sonuçlar birleştirilerek bir sonraki aşamaya aktarılır.
- Yeniden sıralama (Re‑ranking): Birleştirilmiş aday listesi (grafik düğümleri ve metin chunk'ları), en ilgili bilgiyi seçmek amacıyla daha hassas bir model (örneğin, çapraz kodlayıcı) ile yeniden sıralanır. Bu işlem gürültüyü filtreleyerek doğruluğu artırır[7].
- Bağlam paketleme ve üretim: Seçilen ve sıralanan bağlam (alt grafik ve metinler), LLM'in anlayabileceği bir biçime (örneğin, kaynak gösterimli ifadeler listesi) dönüştürülür. Bu zenginleştirilmiş bağlam, nihai yanıtın üretilmesi için prompt'a verilir.
- İzlenebilirlik ve alıntılama: Grafikteki "olgu ↔ kaynak" bağlantısı sayesinde üretilen yanıt, her tezi destekleyen belgelere kesin atıflar içerir. Bu durum yüksek düzeyde gerekçelendirilmiş ve şeffaf yanıtlar sağlar.
Karşılaştırmalı Bileşen Tablosu
| Bileşen/Boyut | Uygulama Seçenekleri | Artıları | Eksileri/Riskleri | Ne Zaman Tercih Edilir |
|---|---|---|---|---|
| Bilgi grafı modeli | RDF/OWL | Katı ontoloji, mantıksal çıkarımlar (reasoning), Linked Open Data ile uyumluluk. | İlişki özelliklerini (zaman, kaynak) ek varlıklar (reification) kullanmadan depolamak güçtür. | Mevcut ontolojilere sahip anlamsal açıdan zengin alanlar; tümdengelim gerektiren durumlar. |
| Property Graph (Neo4j vb.) | Esneklik, düğümler/kenarlarda isteğe bağlı özellikler, yüksek performans. | Açık bir şema gerektirmektedir, yoksa "karmaşa" riski doğar; tek bir standart yoktur. | Yapılandırılmamış verilerle hızlı başlangıç; belgelerle entegrasyon (multi‑model DB). | |
| Alt grafik çıkarımı | k‑hop BFS / DFS | k derinliğine kadar tüm düğümleri kapsar, uygulaması basittir. | Grafik "patlaması": düğüm sayısı çığ gibi büyür; çok fazla gürültü döndürebilir. | Küçük grafıkler veya 1–2 derinlikte dolaşım; hiyerarşik yapılar. |
| Personalized PageRank (PPR) | Gerçekten ilişkili düğümlere odaklanır, gürültü ayıklanır[6]. | Yol sayısı az ama kritik olan uzak bir düğümü gözden kaçırabilir. | Çok sayıda yol içeren karmaşık ağlar (sosyal grafik, alıntı grafı). | |
| Hibrit arama | Birleşik liste (λ ağırlıklı skaler birleştirme) | λ ağırlıklarının ayarlanması, göreve göre precision/recall dengesini kurmayı sağlar[8]. | Sabit λ, tüm sorgu türleri için en uygun değildir. | Prototip aşamasında; bir kaynağın diğerinden açıkça daha önemli olduğu bilindiğinde. |
| Cross‑encoder rerank | Doğrulukta önemli artış; karmaşık ilişkiliklerin hesaba katılabilmesi. | Gecikmeyi artırır; eğitim verisi veya hazır modellerin kullanılmasını gerektirir[7]. | En ilgili bağlamın kritik öneme sahip olduğu yüksek hassasiyetli senaryolar (hukuk, tıp). | |
| Veri güvenliği | Alt grafik filtreleme (RBAC/ABAC) | Düğüm düzeyine kadar ayrıntılı denetim, sızıntıları önler. | "Kör noktalar": önemli bir düğüm çıkarıldığında yanıt eksik kalabilir. | Katı erişim gereksinimleri olan kurumsal ortamlar (PII, GDPR, ticari sırlar). |
İzlenebilirlik, Güven ve Güvenlik
GraphRAG'ın en önemli avantajlarından biri şeffaf kanıt zincirleri sunabilme kapasitesidir. "Kara kutu" türünden bir yanıt vermek yerine sistem, akıl yürütme yolunu gösterebilir: "A olgusu [doc1]'de geçmektedir. B olgusuna [doc2] aracılığıyla bağlıdır ve [doc3]'e göre B, C'ye yol açmaktadır." Bu yaklaşım kullanıcının güvenini artırır ve hata ayıklamayı kolaylaştırır.
Bunun yanı sıra grafik yapısı, ayrıntılı erişim denetimi (RBAC/ABAC) uygulanmasına olanak tanır. Grafikteki her düğüm veya kenara erişim etiketi atanabilir. Alt grafik çıkarımı sırasında sistem, kullanıcının erişim iznine sahip olmadığı verileri otomatik olarak filtreleyerek hassas alanlarda (finans, İK, tıp) güvenliği sağlar.
Kalite Değerlendirmesi
Bir GraphRAG sisteminin değerlendirilmesi çok aşamalıdır ve her bileşen için ölçütler içerir:
- Bilgi çıkarımı ölçütleri: Grafik oluşturma kalitesini değerlendirmek için NER ve RE'ye ilişkin F1 skoru.
- Alt grafik çıkarımı ölçütleri: Subgraph Recall@K (yanıt için gereken düğümlerin/kenarların çıkarılan alt grafa dahil olma oranı) ve multi‑hop sorular için Path Precision/Recall.
- LLM yanıt ölçütleri:
- Faithfulness / Groundedness: Yanıtın sağlanan bağlama ne ölçüde sıkı sıkıya dayandığı.
- Human evaluation: Uzmanların doğruluk, tamlık ve tutarlılık kriterlerine göre değerlendirmesi.
Değerlendirmenin otomatikleştirilmesi için özel benchmark'lar (örneğin, WebQuestionsSP, GrailQA) ve framework'ler (örneğin, RAGAS) kullanılmaktadır[9].
Ayrıca bakınız
- Retrieval‑Augmented Generation (RAG)
- Bilgi Grafı
- Vektör Veritabanı
- Embedding
- AI Ajan
- LLM Değerlendirme ve Benchmark'lar
Kaynakça
- Zhang, Q. et al. (2025). A Survey of Graph Retrieval‑Augmented Generation for Customized Large Language Models. arXiv:2501.13958.
- Xu, Z. et al. (2024). Retrieval‑Augmented Generation with Knowledge Graphs for Customer Service Question Answering. arXiv:2404.17723.
- Hu, Y. et al. (2024). GRAG: Graph Retrieval‑Augmented Generation. arXiv:2405.16506.
- Nakano, R. et al. (2021). WebGPT: Browser‑assisted Question‑Answering with Human Feedback. arXiv:2112.09332.
- Yang, R. et al. (2025). KG‑IRAG: A Knowledge Graph‑Based Iterative Retrieval‑Augmented Generation Framework for Temporal Reasoning. arXiv:2503.14234.
- Song, Y. et al. (2023). Advancements in Complex Knowledge Graph Question Answering: A Survey. DOI:10.3390/electronics12214395.
- Nogueira, R.; Cho, K. (2019). Passage Re‑ranking with BERT. arXiv:1901.04085.
- Hsu, H.‑L.; Tzeng, J. (2025). DAT: Dynamic Alpha Tuning for Hybrid Retrieval in Retrieval‑Augmented Generation. arXiv:2503.23013.
- Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. arXiv:2005.11401.
- Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open‑Domain Question Answering. arXiv:2004.04906.
- Sun, H. et al. (2018). Open‑Domain Question Answering Using Early Fusion of Knowledge Bases and Text (GRAFT‑Net). arXiv:1809.00782.
- Sun, H.; Bedrax‑Weiss, T.; Cohen, W. W. (2019). PullNet: Open‑Domain Question Answering with Iterative Retrieval on Knowledge Bases and Text. arXiv:1904.09537.
- He, X. et al. (2024). G‑Retriever: Retrieval‑Augmented Generation for Textual Graph Understanding and Question Answering. arXiv:2402.07630.
- Es, S.; James, J.; Espinosa‑Anke, L.; Schockaert, S. (2024). RAGAs: Automated Evaluation of Retrieval Augmented Generation. ACL:2024.eacl-demo.16.
Notlar
- ↑ 1.0 1.1 Zhang, Q., et al. A Survey of Graph Retrieval-Augmented Generation for Customized Large Language Models. arXiv, 2025. arXiv:2501.13958.
- ↑ Xu, Z., et al. Retrieval-Augmented Generation with Knowledge Graphs for Customer Service Question Answering. SIGIR, 2024. arXiv:2404.17723; DOI: 10.1145/3626772.3661370.
- ↑ 3.0 3.1 Hu, Y., et al. GRAG: Graph Retrieval‑Augmented Generation. arXiv, 2024. arXiv:2405.16506; также в Findings of NAACL 2025: ACL Anthology.
- ↑ Nakano, R., et al. WebGPT: Browser‑assisted question‑answering with human feedback. arXiv, 2021. arXiv:2112.09332.
- ↑ Yang, R., et al. KG‑IRAG: A Knowledge Graph‑Based Iterative Retrieval‑Augmented Generation Framework for Temporal Reasoning. arXiv, 2025. arXiv:2503.14234.
- ↑ 6.0 6.1 Song, Y., Li, W., Dai, G., Shang, X. Advancements in Complex Knowledge Graph Question Answering: A Survey. Electronics, 2023. DOI: 10.3390/electronics12214395.
- ↑ 7.0 7.1 Nogueira, R., Cho, K. Passage Re‑ranking with BERT. arXiv, 2019. arXiv:1901.04085.
- ↑ Hsu, H.‑L.; Tzeng, J. DAT: Dynamic Alpha Tuning for Hybrid Retrieval in Retrieval‑Augmented Generation. arXiv, 2025. arXiv:2503.23013.
- ↑ Es, S.; James, J.; Espinosa Anke, L.; Schockaert, S. RAGAs: Automated Evaluation of Retrieval Augmented Generation. EACL (System Demonstrations), 2024. ACL:2024.eacl-demo.16; также preprint: arXiv:2309.15217.