Retrieval-augmented generation (RAG) (FA)
Retrieval-Augmented Generation (RAG) (فارسی: تولید تقویتشده با بازیابی) — روشی در حوزه هوش مصنوعی است که در آن مدل زبانی مولد (LLM) به منابع اطلاعاتی خارجی دسترسی دارد تا دقت و اعتبار پاسخها بهبود یابد. به بیان دیگر، مدل پیش از تولید پاسخ، جستجوی دادههای مرتبط (مثلاً در پایگاه اسناد، وبسایت یا پایگاه داده) را انجام میدهد و از اطلاعات یافتشده در تشکیل پاسخ بهره میبرد[1][2]. این رویکرد «تقویت» دانش از منابع بهروز را فراهم میکند و به غلبه بر محدودیتهای LLMها در زمینه حافظه محدود و اطلاعات قدیمی کمک مینماید[3]. سیستم RAG قادر است در پاسخ تولیدشده به اسناد مشخص (مثلاً به شکل پاورقی) ارجاع دهد که این امر شفافیت را افزایش داده و به کاربر امکان تأیید حقایق را میدهد[1]. در نتیجه، خطر بروز توهمات — مواردی که مدل با اطمینان اطلاعات نادرست ارائه میدهد — کاهش مییابد[1][3]. RAG پایگاه دانش LLM را تقریباً به حجم نامحدودی گسترش میدهد و به مدلها اجازه میدهد بدون بازآموزی از جدیدترین دادهها استفاده کنند[4].
خاستگاهها و تکامل روش
ایده ترکیب جستجوی اطلاعات با تولید خودکار پاسخ، بسیار پیش از ظهور LLMهای مدرن شکل گرفت. حتی در دهه ۱۹۷۰ تلاشهایی برای ساخت سیستمهای question-answering صورت گرفت که پاسخ سؤالات را در پایگاههای متنی جستجو میکردند[1]. در دهه ۱۹۹۰ سرویس وب Ask Jeeves جستجوی پاسخ به زبان طبیعی را رواج داد و در سال ۲۰۱۱ سیستم IBM Watson با پیروزی در مسابقه تلویزیونی Jeopardy! بر رقبای انسانی، تواناییهای هوش مصنوعی را به نمایش گذاشت[1].
مرحله نوین توسعه با بکارگیری مدلهای زبانی عصبی پیوند دارد: Retrieval-Augmented Generation به عنوان رویکردی مستقل در سال ۲۰۲۰ توسط گروهی از پژوهشگران Facebook AI Research، University College London و دیگران به رهبری Patrick Lewis پیشنهاد شد[1]. در مقاله آنها که در NeurIPS 2020 پذیرفته شد، مدل RAG توصیف شده است — یک مدل مولد seq2seq (مانند BART) با دسترسی قابل تمایز به حافظه دانش «غیرپارامتری» خارجی[5]. نویسندگان کل ویکیپدیای انگلیسیزبان را به عنوان پایگاه دانش خارجی به کار بردند و آن را به صورت شاخص برداری (~۲۱ میلیون قطعه متنی) نمایش دادند که جستجو در آن با الگوریتم عصبی Dense Passage Retrieval انجام میشود[5]. برای یک پرسش ورودی، مدل RAG مناسبترین قطعات را از شاخص استخراج کرده و آنها را به زمینه تولید پاسخ اضافه میکند. این مکانیزم دستیابی به نتایج رکوردشکن (state-of-the-art) در وظایف با پایگاه دانش باز، مثلاً در آزمونهای Natural Questions، WebQuestions و غیره را ممکن ساخت[2]. یادآوری شده که پاسخهای مدل RAG در مقایسه با رویکردهای مولد پیشین، به دلیل ترکیب اطلاعات از چندین منبع، تخصصیتر و از نظر واقعی دقیقتر بودند[2]. به زودی Facebook کد منبع RAG را به صورت آزاد منتشر کرد: مدل در کتابخانه HuggingFace Transformers و مجموعه داده مرتبط با آن یکپارچه شد که به توسعهدهندگان امکان داد RAG را به راحتی در پروژههای خود بهکار گیرند[2]. از سال ۲۰۲۰ روش RAG به سرعت محبوبیت یافت — به گفته نویسنده، علیرغم مخفف نامأنوس، این رویکرد گسترش وسیعی یافت و صدها مقاله علمی پدید آورد و پایه بسیاری از سرویسهای تجاری شد[1].
اصل کار RAG
طرح اصلی Retrieval-Augmented Generation: ماژول جستجو (سمت چپ) اسناد مرتبط را از پایگاه دانش استخراج میکند، سپس مدل مولد (سمت راست) پاسخ را بر اساس پرسش کاربر و با در نظر گرفتن اطلاعات یافتشده شکل میدهد[6]. این رویکرد به LLM امکان میدهد هنگام تولید پاسخ بر دادههای خارجی بهروز تکیه کند. در نمودار نشان داده شده که چگونه پرسش کاربر به بردار تبدیل شده و برای جستجوی قطعات متنی مشابه به کار میرود؛ سپس این قطعات به زمینه مدل متصل میشوند و دانش آن را «گسترش» داده و دقت پاسخ را افزایش میدهند.
سیستم RAG معمولاً از دو مؤلفه اصلی تشکیل شده است: ماژول جستجو (retriever) و ماژول تولید پاسخ (generator)[6]. در مرحله آمادهسازی، یک شاخص برداری از پایگاه دانش ساخته میشود: تمام اسناد (متون) به قطعاتی تقسیم شده و توسط مدل embedding به بردارهای عددی تبدیل میشوند که برای جستجوهای بعدی در پایگاه داده تخصصی ذخیره میگردند[6]. هنگام دریافت پرسش کاربر، همان مدل embedding پرسش را به بردار تبدیل میکند؛ سپس جستجوی نزدیکترین همسایگان در فضای برداری انجام شده — top K قطعه مشابهترین از شاخص دانش انتخاب میشود (مثلاً K = 5)[6]. این قطعات به عنوان زمینه خارجی حاوی حقایق احتمالی مرتبط با موضوع پرسش تلقی میشوند.
در مرحله بعد، زمینه تشکیلشده توسط مدل مولد مورد استفاده قرار میگیرد. پرسش اصلی به همراه قطعات متنی یافتشده به LLM (مثلاً یک transformer از نوع seq2seq یا مدل دستورمحور) داده میشود تا پاسخ نهایی تولید شود[2]. بنابراین مدل زبانی به طور مشروط نه تنها بر دانش آموختهشده (پارامتری) خود، بلکه بر دادههای خارجی ارائهشده نیز تکیه میکند. در پیادهسازی اصلی RAG، نقش مولد را مدل از پیشآموزشدیده BART ایفا میکرد و «حافظه» خارجی توسط مجموعه Wikipedia ایندکسشده به روش DPR نمایش داده میشد[5].
رویکرد Fusion در ترکیب دانش
ویژگی مهم RAG، شیوهای است که مدل اطلاعات چندین سند یافتشده را ترکیب میکند. برخلاف الحاق ساده تمام متون، RAG از رویکردی موسوم به late fusion («ادغام دیرهنگام نتایج») استفاده میکند — مدل مولد هر یک از K قطعه دریافتی را به صورت موازی پردازش کرده و برای آن پاسخ فرضی با میزان اطمینان تولید میکند، سپس این گزینهها را در خروجی نهایی تجمیع مینماید[2]. این روش به RAG امکان میدهد حتی در مواردی که هیچ منبع منفردی پاسخ مستقیم و کامل به پرسش را در بر ندارد، پاسخ را ترکیب کند. به عنوان مثال، اگر اطلاعات مورد نیاز در مقالات مختلف پراکنده باشد، مدل قادر است «سرنخها» را از چند سند در یک پاسخ واحد گرد آورد[2] (یادآوری شده که افزایش تعداد اسناد مورد استفاده معمولاً جامعیت پاسخ را به قیمت کاهش اندک انسجام متن بهبود میبخشد[7].)
انواع پیادهسازی
در مقاله اصلی سال ۲۰۲۰ دو نوع معماری RAG پیشنهاد شده است[6]. در حالت RAG-Sequence مدل مولد مجموعه ثابتی از اسناد یافتشده را دریافت کرده و از آنها برای تولید کل پاسخ به صورت یکجا استفاده میکند. در حالت RAG-Token برعکس، بهروزرسانی پویا مجاز است: در هر گام تولید token بعدی، مدل میتواند جستجو را دوباره انجام داده و قطعه متنی اضافی را در صورت نیاز برای دقیقسازی پاسخ بارگذاری کند. هر دو رویکرد سطح کیفی بالای مشابهی نشان میدهند؛ RAG-Sequence سادهتر و سریعتر است، در حالی که RAG-Token از نظر نظری امکان در نظر گرفتن اطلاعات بیشتر و متنوعتر در پاسخهای طولانی را فراهم میکند[6].
مزایای RAG
- بهروز بودن و دقت واقعی. اتصال به دادههای خارجی به LLM امکان میدهد پاسخهای دقیقتر و مستدلتری ارائه دهد و بر اطلاعات واقعی تکیه کند، نه فقط بر پارامترهای مدل. این امر خطر ارائه اطلاعات قدیمی یا صرفاً ساختگی در پاسخ مدل را به طور قابل توجهی کاهش میدهد[3][1]. برخلاف مدلهایی با «برش زمانی» ثابت دانش، RAG میتواند حتی به پرسشهایی درباره رویدادها یا حقایقی که پس از پایان آموزش مدل پدید آمدهاند پاسخ دهد — از طریق دسترسی به منابع داده تازه[4].
- شفافیت و اعتماد کاربران. سیستمهای RAG قادرند لینک به منابع اطلاعاتی (مانند مقالات، گزارشها یا پایگاههای داده) که پایه پاسخ بودهاند را ارائه دهند[1]. در واقع مدل پاسخهای خود را همانند یک اثر علمی با پاورقی تنظیم میکند که امکان تأیید صحت هر حقیقت را فراهم میسازد. وجود منابع اولیه استنادشده اعتماد کاربران را افزایش داده و تأیید اطلاعات دریافتی را آسانتر میکند.
- تخصصیسازی برای حوزه موضوعی. Retrieval-augmentation امکان میدهد بدون تغییر خود مدل زبانی، عملکرد آن را نسبتاً آسان برای یک حوزه دانشی محدود تطبیق دهیم. برای این کار کافی است LLM را به پایگاه دانش تخصصی درباره موضوع مورد نظر مجهز کنیم — چه مقالات پزشکی، چه اسناد حقوقی یا راهنماهای فنی شرکت باشند. مدل با حفظ پارامترهای عمومی خود، در نقش متخصص آن حوزه ظاهر میشود، زیرا حقایق را از dataset انتخابشده استخراج میکند[4][8]. به عنوان مثال، دستیار حقوقی مبتنی بر RAG میتواند حوزه جستجو را به یک corpus حقوقی (قوانین یک کشور خاص) محدود کند و تضمین دهد که پاسخها دقیقاً با آن قوانین مطابقت دارند[8].
- انعطافپذیری و قابلیت بهروزرسانی دانش. در مدلهای کلاسیک، برای افزودن دانش جدید یا اصلاح حقایق نادرست، انجام آموزش مجدد (fine-tuning) روی dataset گسترشیافته لازم بود که از نظر زمان و منابع پرهزینه است. RAG این مشکل را حل میکند: برای بهروزرسانی دانش مدل، کافی است پایگاه داده خارجی بهروز شود یا منابع اضافی متصل گردند و مدل بلافاصله از اطلاعات جدید استفاده خواهد کرد[2]. این امر نگهداری بهروز سیستم را آسان میکند — در واقع دادهها را میتوان حتی در زمان واقعی بدون وقفه در کار مدل «بهصورت گرم» جایگزین کرد[1].
- کارایی و صرفهجویی در منابع. رویکرد RAG اغلب عملیتر از آموزش مدلهای فوقالعاده بزرگی است که میکوشند تمام اطلاعات را در پارامترهای خود جای دهند. با یکپارچهسازی جستجو، میتوان با مدلی با اندازه متوسط به نتایج قابل مقایسهای رسید بدون اینکه سعی شود تمام حقایق درون خود شبکه عصبی حفظ شوند[6]. علاوه بر این، پیادهسازی pipeline مبتنی بر RAG نسبتاً ساده است: ابزارهای آماده (Frameworks، کتابخانهها) وجود دارند و توسعهدهندگان نشان میدهند که یک نمونه اولیه RAG را میتوان تحتاللفظی در چند خط کد ساخت[1]. بنابراین RAG هزینههای کلی استقرار هوش مصنوعی را کاهش میدهد: به جای آموزش مدل جدید برای هر وظیفه، کافی است مکانیزم جستجو تنظیم شده و دادههای مناسب ارائه گردد.
مشکلات و محدودیتهای RAG
علیرغم مزایای آشکار، Retrieval-Augmented Generation محدودیتهایی را هم از مؤلفههای جستجو و هم از خود مدلهای زبانی به ارث میبرد[9]. در ادامه مشکلات کلیدی سیستمهای RAG برشمرده شده است:
- وابستگی به کیفیت جستجو. پاسخ دریافتی دقیقاً به همان اندازهای صحیح خواهد بود که دادههای استخراجشده مرتبط و قابل اعتماد باشند. اگر ماژول جستجو اسنادی را برگرداند که به پرسش مربوط نیستند یا حاوی خطا هستند، مدل مولد قادر نخواهد بود این حقایق را «اصلاح کند» — پاسخ را بر اساس آنها تولید میکند[8]. بنابراین کیفیت و بهروز بودن پایگاه دانش خارجی مستقیماً دقت RAG را تعیین میکند. بهروزرسانی منظم شاخص و تنظیم الگوریتمهای رتبهبندی برای حفظ ارتباط نتایج اسناد ضروری است.
- پیچیدگی و منابعبری بالا. سیستم RAG برای کار نه تنها به خود LLM، بلکه به زیرساخت جستجو نیاز دارد: ذخیرهسازی و بهروزرسانی پایگاه داده بزرگ، ایندکسگذاری، زمان اجرای پرسش. همه اینها هزینههای محاسباتی را افزایش داده و ممکن است در مقایسه با مدل زبانی به تنهایی سرعت پاسخ را کاهش دهد[8]. در بدترین حالت، تأخیر در مرحله جستجو یا پردازش حجم بسیار زیادی از دادهها سیستم را کند میکند. در عمل باید بین کیفیت پاسخ و کارایی توازن برقرار شود، با بهینهسازی pipeline (مثلاً محدود کردن اندازه پایگاه دانش یا عمق جستجو برای حفظ زمان پاسخ در حد قابل قبول).
- الزامات داده و پشتیبانی. برای کارایی مؤثر RAG، دادههای خارجی باکیفیت، ساختاریافته و قابل دسترس لازم است. مدل جستجو ممکن است در یافتن اطلاعات مفید دچار مشکل شود اگر پایگاه دانش خارجی ضعیف سازمانیافته یا دارای نویز باشد[8]. علاوه بر این، دادههای مورد نیاز همیشه در دسترس یا ارزان نیستند: شرکتها مجبورند knowledge bases اختصاصی خود را ایجاد و نگهداری کنند. این امر هزینههای اضافی ایجاد کرده و به تلاش برای بهروزرسانی دادهها نیاز دارد (مثلاً افزودن اسناد جدید، پاکسازی اطلاعات قدیمی). نقطه ضعف RAG وابستگی به نگهداری پایگاه دانش در وضعیت بهروز است.
- ناپذیر بودن برخی خطاهای LLM. اگرچه RAG تعداد تناقضات را به طور چشمگیری کاهش میدهد، حذف کامل پاسخهای نادرست همیشه ممکن نیست[9]. مدل مولد همچنان میتواند خطای منطقی مرتکب شود یا اطلاعات را نادرست تعمیم دهد، به خصوص اگر زمینه ارائهشده کافی نباشد یا متناقض باشد[9]. در واقع RAG تأکید خطاها را جابجا میکند: به جای حقایق کاملاً ساختگی («توهمات»، «hallucination»)، بیشتر خطاهای یکپارچهسازی دانش رخ میدهند — مثلاً مدل ممکن است قطعه مهمی را از قلم بیندازد یا منابع مختلف را نادرست به هم ربط دهد. بنابراین در کاربردهای حساس (پزشکی، حقوق) همچنان نیاز به مشارکت انسان برای تأیید و اصلاح پاسخهای سیستم وجود دارد.
کاربردهای RAG
روش Retrieval-Augmented Generation در سناریوهای متعددی مرتبط با استخراج و استفاده از دانش کاربرد یافته است. در ادامه حوزههای اصلی که RAG بیشترین سودمندی را نشان میدهد برشمرده شده است:
- سیستمهای پرسش و پاسخ و چتباتها. RAG امکان ایجاد دستیاران مجازی و چتباتهایی را فراهم میکند که با دقت بالا به پرسشهای کاربران پاسخ داده و میتوانند لینک به منابع ارائه دهند. در حوزه پشتیبانی مشتری، چنین رباتهایی به پایگاه دانش داخلی شرکت (FAQ، مقالات راهنما) مراجعه کرده و پاسخهای فوری به درخواستهای مشتریان ارائه میدهند و بار کاری کارمندان را کاهش میدهند[8]. برخلاف سیستمهای کلاسیک FAQ، رباتهای RAG پاسخ را به زبان طبیعی فرموله میکنند اما در عین حال آن را با دادههای بهروز خاص مشکل کاربر «تأیید» مینمایند.
- پزشکی و بهداشت. یک مدل مولد تقویتشده با پایگاه داده پزشکی تخصصی (مقالات علمی، پروتکلهای بالینی، راهنماها) میتواند به عنوان دستیار هوشمند پزشک یا بیمار عمل کند. به عنوان مثال، سیستم میتواند به پرسشی درباره یک تشخیص نادر با یافتن تحقیقات جدید مرتبط در ادبیات پزشکی پاسخ دهد[8]. مزیت مهم RAG در پزشکی امکان ارجاع به منابع اولیه (مانند نتایج کارآزماییهای بالینی) است که برای اعتماد پزشکان ضروری است. چنین سیستمهایی برای پشتیبانی از تصمیمگیری، بررسی علائم، آموزش دانشجویان پزشکی و غیره بهکار میروند و دسترسی به جدیدترین دانش پزشکی را فراهم میکنند.
- حقوق و مالی. در عمل حقوقی و تحلیل مالی دقت و قابلیت تأیید اطلاعات اهمیت ویژهای دارد. سیستمهای RAG میتوانند به متخصصان در یافتن سریع دادههای لازم کمک کنند: مثلاً یک وکیل با کمک مدل یک رأی قضایی سابقهساز یا مادهای از قانون مرتبط با پرونده جاری را پیدا کرده و نقل قول میکند، و یک تحلیلگر مالی به سرعت گزیدههایی از گزارشهای اقتصادی تازه یا اخبار بازار دریافت میکند[8]. در عین حال هر پاسخ مدل میتواند شامل لینک به اسناد مشخص (مقررات، گزارشها، مقالات) باشد که با استانداردهای صنعت مطابقت داشته و کار دستی بعدی متخصص را آسانتر میکند.
- پژوهش علمی و تولید محتوا. روزنامهنگاران، پژوهشگران و نویسندگان میتوانند از RAG برای تسریع جستجوی حقایق و منابع در آمادهسازی مطالب استفاده کنند. به عنوان مثال، مدل میتواند بر اساس درخواست اطلاعات را از چند منتشرات معتبر «جمعآوری» کند و زمان صرفشده برای fact-checking و انتخاب نقل قولها را به طور قابل توجهی کاهش دهد[8]. دستیاران پژوهشی مبتنی بر RAG به صورت خودکار لینک به آثار مرتبط، دادههای پایگاههای آزاد (مانند آمار از گزارشهای بینالمللی) و حتی پیشنویس ترجمهها را استخراج میکنند و به نویسندگان امکان میدهند بر بخش تحلیلی کار متمرکز شوند. ابزارهای مشابه در رسانهها، محیط دانشگاهی، در تهیه مرورهای ادبیات و غیره کاربرد مییابند.
- دانش سازمانی و جستجو در اسناد. در بسیاری از سازمانها حجم قابل توجهی از اطلاعات ارزشمند به صورت اسناد متنی ذخیره میشود: آییننامهها، راهنماها، گزارشها، مکاتبات، فایلهای گزارش. RAG روشی برای جستجوی تعاملی در چنین دادههای غیرساختاریافته با استفاده از زبان طبیعی فراهم میکند. یک کارمند میتواند پرسشی مطرح کند («درباره سیاست مرخصی برای کارمندان از راه دور چه میگوید؟») — و مدل بخش مورد نیاز سند داخلی را پیدا کرده، از آن نقل میکند و پاسخ خلاصهای تشکیل میدهد[1]. این امر کارایی کار را افزایش میدهد: کارمندان جدید سریعتر پاسخ سؤالات خود را مییابند، بخشهای پشتیبانی ابزاری برای جستجوی سریع در پایگاه حوادث دریافت میکنند و مدیریت روشی برای تحلیل دادههای متنی انباشتهشده در اختیار دارد. شرکتهای بزرگ فناوری اطلاعات در حال حاضر رویکرد RAG را در راهحلهای سازمانی پیاده میکنند: فناوریهای Microsoft، Google، IBM، AWS و دیگران LLM را با جستجو در دادههای سازمان یکپارچه میکنند[1].
چشماندازها و پژوهشهای آتی
روش Retrieval-Augmented Generation به طور فعال در حال توسعه است و در سالهای آینده گسترش بیشتری از امکانات آن انتظار میرود. یکی از مسیرها، RAG چندوجهی است که در آن اطلاعات خارجی میتوانند نه تنها متون، بلکه تصاویر، صدا/ویدیو یا حتی دادههای حسگرها باشند. آزمایشها چشمانداز ترکیب مدلهای زبانی با جستجو در پایگاههای داده بصری را نشان میدهند که به عنوان مثال امکان پاسخ به پرسشهایی درباره محتوای تصاویر یا ویدیو بر اساس توصیفات و متون مرتبط را فراهم خواهد کرد[2]. مسیر مهم دیگر — استفاده همزمان از چندین منبع دانشی است: سیستمهای آینده RAG خواهند توانست دادههای پایگاههای مختلف (مثلاً Wikipedia، دانشنامههای تخصصی، یادداشتهای شخصی کاربر) را ترکیب کرده و با در نظر گرفتن تمام این اطلاعات ناهمگون پاسخها را ترکیب کنند[2].
پیش روی پژوهشگران همچنین وظیفه افزایش قابلیت اطمینان و ایمنی RAG قرار دارد. لازم است خطر انتشار تعصبات و خطاهایی که ممکن است در دادههای خارجی وجود داشته باشند به حداقل برسد و سازگاری پاسخها تضمین شود. تیم توسعهدهندگان RAG اصلی در این زمینه گامهایی برداشته بودند — مثلاً با محدود کردن پایگاه دانش اولیه فقط به مقالات Wikipedia به عنوان منبعی نسبتاً تأییدشده و بیطرف[2]. در آینده برنامهریزی شده است که فیلترهای خاص و روشهای انتخاب اسناد ایجاد شود تا مدل بتواند قطعاً زمینه باکیفیت دریافت کند. علاوه بر این، پژوهشها بر بهبود خود مکانیزم جستجو متمرکز شدهاند: الگوریتمهای جدید رتبهبندی و ایندکسگذاری معنایی در حال توسعه هستند که قادرند پرسشها را با دقت بیشتر درک کرده و اطلاعات مرتبط را حتی برای فرمولهبندیهای پیچیده یا مبهم بیابند.
در نهایت، یکپارچهسازی عمیقتر RAG با فرایند آموزش مدلهای زبانی مورد توجه است. رویکردهایی در حال ظهور هستند که در آنها مکانیزمهای retrieval نه تنها در مرحله استنتاج، بلکه در آموزش اولیه یا fine-tuning مدل LLM نیز استفاده میشوند[10]. این میتواند واقعیگرایی واقعی مدلها را بیشتر افزایش داده و وابستگی آنها به دانش ثبتشده به صورت ایستا در وزنها را کاهش دهد. بر اساس مرورهایی که در سال ۲۰۲۴ منتشر شدهاند، جامعه چشماندازهای بزرگی در توسعه اکوسیستم RAG میبیند: از بهینهسازی زیرساخت (تسریع جستجو، کاهش هزینههای حافظه) تا ایجاد benchmarkهای استاندارد برای ارزیابی کیفیت سیستمهای RAG[3]. همه اینها برای دقیقتر، همهجانبهتر و ایمنتر کردن مدلهای مولد در کار با دانش خارجی در حال بهروزرسانی مداوم طراحی شده است که گامی کلیدی در مسیر هوش مصنوعی قابل اعتماد نسل جدید است.
پیوندها
- Retrieval-Augmented Generation (RAG) چیست — وبلاگ NVIDIA
- Retrieval-Augmented Generation for Large Language Models: A Survey — مرور علمی در arXiv
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — مقاله اصلی درباره RAG
- RAG چیست؟ کاربردها، محدودیتها و چالشها — وبلاگ Bright Data
منابع
- Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401.
- Karpukhin, V. et al. (2020). Dense Passage Retrieval for Open-Domain Question Answering. arXiv:2004.04906.
- Guu, K. et al. (2020). REALM: Retrieval-Augmented Language Model Pre-Training. arXiv:2002.08909.
- Qu, Y. et al. (2020). RocketQA: An Optimized Training Approach to Dense Passage Retrieval for Open-Domain Question Answering. arXiv:2010.08191.
- Izacard, G.; Grave, E. (2021). Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering. arXiv:2007.01282.
- Borgeaud, S. et al. (2022). Improving Language Models by Retrieving from Trillions of Tokens. arXiv:2112.04426.
- Wei, J. et al. (2022). Chain of Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
- Kojima, T. et al. (2022). Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916.
- Yao, S. et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629.
- Mialon, G. et al. (2023). Retrieval-Augmented Generation for Large Language Models: A Survey. arXiv:2312.10997.
- Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
- Yang, Z. et al. (2023). Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning. arXiv:2302.04858.
- Barnett, S. et al. (2024). Seven Failure Points When Engineering a Retrieval Augmented Generation System. arXiv:2401.05856.
- Wang, Y. et al. (2024). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
- Han, H. et al. (2025). Retrieval-Augmented Generation with Graphs (GraphRAG). arXiv:2501.00309.
یادداشتها
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 «What Is Retrieval-Augmented Generation aka RAG». NVIDIA Blogs. [۱]
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 «Facebook open-sources RAG, an AI model that retrieves documents to answer questions». VentureBeat. [۲]
- ↑ 3.0 3.1 3.2 3.3 Mialon, Grégoire et al. «Retrieval-Augmented Generation for Large Language Models: A Survey». arXiv. [۳]
- ↑ 4.0 4.1 4.2 «Applied AI Software Engineering: RAG». Pragmatic Engineer. [۴]
- ↑ 5.0 5.1 5.2 Lewis, Patrick et al. «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks». arXiv. [۵]
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 6.6 «How RAG Makes LLMs Smarter». Exxact Blog. [۶]
- ↑ «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks». arXiv. [۷]
- ↑ 8.0 8.1 8.2 8.3 8.4 8.5 8.6 8.7 8.8 «What Is RAG? Use Cases, Limitations, and Challenges». Bright Data Blog. [۸]
- ↑ 9.0 9.1 9.2 Lewis, Patrick et al. «Seven Failure Points When Engineering a Retrieval Augmented Generation System». arXiv. [۹]
- ↑ «Генерация, дополненная поиском». Википедия. [۱۰]