---
title: "Retrieval-augmented generation (RAG) (IT)"
source: "https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)"
wiki: "systems-analysis.info/int"
article: "Retrieval-augmented_generation_(RAG)_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 6391
wiki_created_at: 2026-09-07T00:03:43Z
wiki_modified_at: 2026-09-07T00:03:43Z
downloaded_at: 2026-09-07T23:13:41Z
---

# Retrieval-augmented generation (RAG) (IT)

**Retrieval-Augmented Generation (RAG)** (*it. Generazione Aumentata dal Recupero*) — è un metodo nel campo dell'intelligenza artificiale in cui un **modello linguistico generativo** (**LLM**) è dotato di accesso a fonti di informazione esterne per migliorare la precisione e l'affidabilità delle risposte. In altre parole, il modello, prima di generare una risposta, esegue una **ricerca di dati rilevanti** (ad esempio in una base documentale, su un sito web o in un database) e utilizza le informazioni trovate nella formulazione della risposta<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup>. Tale approccio garantisce un **«arricchimento» con conoscenze** provenienti da fonti aggiornate e aiuta a superare i limiti degli LLM stessi, legati alla capacità limitata della «memoria» e alle informazioni obsolete<sup>[\[3\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-survey-3)</sup>. Un sistema RAG è in grado di fare riferimento a documenti specifici (ad esempio sotto forma di note a piè di pagina) nella risposta generata, il che aumenta la trasparenza e consente all'utente di verificare i fatti<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>. Ne consegue una riduzione del rischio di **allucinazioni** — i casi in cui il modello fornisce con sicurezza informazioni false<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)[\[3\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-survey-3)</sup>. RAG espande la base di conoscenze degli LLM a un volume praticamente illimitato e consente ai modelli di utilizzare i dati più recenti senza necessità di ri-addestramento<sup>[\[4\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-pragmaticengineer-rag-4)</sup>.

## Origini e sviluppo del metodo

L'idea di combinare la ricerca di informazioni con la generazione automatica di risposte è nata molto prima della comparsa dei moderni LLM. Già negli anni '70 venivano compiuti tentativi di creare sistemi di **question-answering** che cercavano risposte in basi di dati testuali sulla base di una domanda fornita<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>. Negli anni '90 comparve il servizio web Ask Jeeves, che ha reso popolare la ricerca di risposte in linguaggio naturale, e nel 2011 il sistema IBM Watson ha dimostrato le capacità dell'IA vincendo il programma televisivo Jeopardy! contro partecipanti umani<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>.

La fase moderna dello sviluppo è legata all'introduzione dei modelli linguistici neurali: il **Retrieval-Augmented Generation** come approccio distinto è stato proposto nel 2020 da un gruppo di ricercatori di Facebook AI Research, dell'University College London e altri, sotto la guida di Patrick Lewis<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>. Nel loro lavoro, accettato a NeurIPS 2020, è descritto il modello RAG — un modello generativo seq2seq (ad esempio BART) con **accesso differenziabile** a un archivio di conoscenze esterno «non parametrico»<sup>[\[5\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-original-5)</sup>. Gli autori hanno utilizzato come base di conoscenza esterna l'intera Wikipedia in lingua inglese, rappresentandola come un **indice vettoriale** (~21 milioni di frammenti di testo), su cui viene eseguita la ricerca tramite l'algoritmo neurale **Dense Passage Retrieval**<sup>[\[5\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-original-5)</sup>. Per una query in ingresso, il modello RAG estrae dall'indice i frammenti più pertinenti e li aggiunge al contesto per la generazione della risposta. Tale meccanismo ha permesso di raggiungere nuovi risultati record (state-of-the-art) su compiti con base di conoscenza aperta, ad esempio nei test Natural Questions, WebQuestions e altri<sup>[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup>. È stato osservato che le risposte del modello RAG risultavano più specifiche e fattualmente corrette rispetto ai precedenti approcci generativi, grazie alla sintesi di informazioni provenienti da più fonti contemporaneamente<sup>[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup>. Poco dopo Facebook ha pubblicato apertamente il codice sorgente di RAG: il modello è stato integrato nella libreria HuggingFace Transformers e nel relativo dataset, consentendo agli sviluppatori di applicare facilmente RAG nei propri progetti<sup>[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup>. Dal 2020 la metodologia RAG ha rapidamente guadagnato popolarità — secondo le parole dell'autore, nonostante l'acronimo poco eufonico, l'approccio ha trovato ampia diffusione, generando centinaia di lavori scientifici e diventando la base di numerosi servizi commerciali<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>.

## Principio di funzionamento di RAG

Schema concettuale del Retrieval-Augmented Generation: il modulo di ricerca (a sinistra) estrae i documenti rilevanti dalla base di conoscenze, dopodiché il modello generativo (a destra) formula la risposta sulla base della query dell'utente tenendo conto delle informazioni trovate<sup>[\[6\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-exxact-blog-6)</sup>. Tale approccio consente all'LLM di fare affidamento su **dati esterni aggiornati** durante la generazione della risposta. Il diagramma mostra come la query dell'utente viene trasformata in un vettore e utilizzata per cercare frammenti di testo simili; questi vengono poi collegati al contesto del modello, «espandendo» le sue conoscenze e aumentando la precisione della risposta.

Un sistema RAG è generalmente composto da due componenti principali: il **modulo di ricerca** (retriever) e il **modulo di generazione della risposta** (generator)<sup>[\[6\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-exxact-blog-6)</sup>. Nella fase di preparazione viene costruito un **indice vettoriale** della base di conoscenze: tutti i documenti (testi) vengono suddivisi in frammenti e trasformati da un modello di **embedding** in vettori numerici, che vengono memorizzati in un database specializzato per la successiva ricerca<sup>[\[6\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-exxact-blog-6)</sup>. Alla ricezione di una query dell'utente, lo stesso modello di embedding codifica la query in un vettore; viene quindi eseguita la ricerca dei **vicini più prossimi** nello spazio vettoriale — vengono selezionati i top K frammenti più simili dall'indice di conoscenze (ad esempio K = 5)<sup>[\[6\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-exxact-blog-6)</sup>. Questi frammenti sono considerati il contesto esterno contenente probabili fatti sull'argomento della query.

Nella fase successiva, il contesto così formato viene utilizzato dal modello generativo. La domanda originale insieme ai frammenti di testo trovati viene fornita in ingresso all'LLM (ad esempio un transformer di tipo seq2seq o un modello orientato alle istruzioni) per la **generazione della risposta finale**<sup>[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup>. Il modello linguistico si basa quindi non solo sulle proprie conoscenze apprese (parametriche), ma anche sui dati esterni forniti. Nell'implementazione originale di RAG, il ruolo del generatore era svolto dal modello pre-addestrato BART, mentre la «memoria» esterna era rappresentata dalla collezione Wikipedia indicizzata con il metodo DPR<sup>[\[5\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-original-5)</sup>.

### Fusion - Approccio alla combinazione delle conoscenze

Una caratteristica importante di RAG è il modo in cui il modello combina le informazioni provenienti da più documenti trovati. A differenza della semplice concatenazione di tutto il testo, RAG applica un approccio noto come **late fusion** («fusione tardiva dei risultati») — il modello generativo elabora in parallelo ciascuno dei K frammenti ottenuti, formula per ognuno una risposta ipotetica con una stima di confidenza, dopodiché aggrega queste varianti nell'output finale<sup>[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup>. Tale metodo consente a RAG di sintetizzare una risposta anche nei casi in cui nessuna singola fonte contiene una risposta diretta e completa alla domanda. Ad esempio, se le informazioni necessarie sono distribuite tra articoli diversi, il modello è in grado di combinare gli «indizi» provenienti da più documenti in un'unica risposta<sup>[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup> (È stato osservato che l'aumento del numero di documenti utilizzati di solito migliora la completezza della risposta a scapito di una lieve perdita di coerenza del testo<sup>[\[7\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-original-pdf-7)</sup>.)

### Varianti di implementazione

Nel lavoro originale del 2020 sono state proposte due modifiche dell'architettura RAG<sup>[\[6\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-exxact-blog-6)</sup>. Nella modalità **RAG-Sequence** il modello generativo riceve un insieme fisso di documenti trovati e li utilizza per produrre l'intera risposta nella sua interezza. Nella modalità **RAG-Token**, al contrario, è consentito un aggiornamento dinamico: ad ogni passo di generazione del token successivo, il modello può eseguire nuovamente la ricerca e caricare un ulteriore frammento di testo, se necessario per affinare la risposta. Entrambi gli approcci mostrano un livello di qualità simile ed elevato; RAG-Sequence è più semplice e veloce, mentre RAG-Token consente teoricamente di tenere conto di una maggiore varietà di informazioni nelle risposte lunghe<sup>[\[6\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-exxact-blog-6)</sup>.

## Vantaggi di RAG

- **Attualità e precisione fattuale**. Il collegamento a dati esterni consente agli LLM di fornire risposte più precise e fondate, basandosi su informazioni reali e non solo sui parametri del modello. Ciò riduce significativamente il rischio di informazioni obsolete o semplicemente inventate nella risposta del modello<sup>[\[3\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-survey-3)[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>. A differenza dei modelli con un «limite di conoscenza» fisso, RAG può rispondere anche a domande su eventi o fatti comparsi dopo la conclusione dell'addestramento del modello — grazie all'accesso a fonti di dati aggiornate<sup>[\[4\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-pragmaticengineer-rag-4)</sup>.
- **Trasparenza e fiducia degli utenti**. I sistemi RAG sono in grado di fornire **riferimenti** alle fonti delle informazioni (ad esempio articoli, rapporti o database) che hanno costituito la base della risposta<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>. In sostanza, il modello struttura le proprie risposte come un lavoro scientifico con note a piè di pagina, il che consente di verificare l'affidabilità di ogni fatto. La presenza di fonti citate aumenta la fiducia degli utenti e facilita la **verifica** delle informazioni ottenute.
- **Specializzazione in un dominio tematico**. Il retrieval-augmentation offre la possibilità di adattare relativamente facilmente il funzionamento del modello a un **dominio di conoscenza ristretto**, senza modificare il modello linguistico stesso. A tal fine è sufficiente fornire all'LLM una base di conoscenze specializzata sull'argomento desiderato — che si tratti di articoli medici, documenti giuridici o manuali tecnici aziendali. Il modello, pur rimanendo generico nei suoi parametri, inizia ad agire come un esperto in quel settore, attingendo i fatti dal dataset selezionato<sup>[\[4\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-pragmaticengineer-rag-4)[\[8\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-brightdata-blog-8)</sup>. Ad esempio, un assistente legale basato su RAG può limitare l'area di ricerca a un corpus giurisdizionale specifico (le leggi di un determinato paese), garantendo che le risposte siano conformi a quella legislazione<sup>[\[8\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-brightdata-blog-8)</sup>.
- **Flessibilità e aggiornabilità delle conoscenze**. Nei modelli classici, per aggiungere nuove conoscenze o correggere fatti errati era necessario eseguire un nuovo addestramento (fine-tuning) su un dataset esteso, il che è costoso in termini di tempo e risorse. RAG risolve questo problema: per **aggiornare le conoscenze** del modello è sufficiente aggiornare il database esterno o collegare fonti aggiuntive, e il modello inizierà immediatamente a utilizzare le nuove informazioni<sup>[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup>. Ciò consente di mantenere facilmente il sistema aggiornato — di fatto, i dati possono essere sostituiti «a caldo» persino in tempo reale senza interruzioni del funzionamento del modello<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>.
- **Efficienza e risparmio di risorse**. L'approccio RAG si rivela spesso più pratico rispetto all'addestramento di modelli di grandissime dimensioni che cercano di incorporare tutte le informazioni nei propri parametri. Integrando la ricerca, è possibile ottenere risultati comparabili con un modello di dimensioni moderate, senza cercare di memorizzare assolutamente tutti i fatti all'interno della rete neurale stessa<sup>[\[6\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-exxact-blog-6)</sup>. Inoltre, l'implementazione di una pipeline RAG è relativamente semplice: esistono strumenti pronti all'uso (Frameworks, librerie) e gli sviluppatori dimostrano che un prototipo RAG di base può essere assemblato in poche righe di codice<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>. RAG riduce quindi i costi complessivi di implementazione dell'IA: invece di addestrare un nuovo modello per ogni compito, è sufficiente configurare il meccanismo di ricerca e fornire i dati appropriati.

## Problemi e limitazioni di RAG

Nonostante gli evidenti pregi, il Retrieval-Augmented Generation eredita le limitazioni sia dai componenti di ricerca sia dai modelli linguistici stessi<sup>[\[9\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-failure-points-9)</sup>. Di seguito sono elencati i principali problemi caratteristici dei sistemi RAG:

- **Dipendenza dalla qualità della ricerca**. La risposta ottenuta sarà corretta esattamente nella misura in cui i dati estratti sono rilevanti e affidabili. Se il modulo di ricerca restituisce documenti non pertinenti alla domanda o contenenti errori, il modello generativo non sarà in grado di «correggere» questi fatti — genererà una risposta basandosi su di essi<sup>[\[8\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-brightdata-blog-8)</sup>. Pertanto, la qualità e l'attualità della base di conoscenze esterna determinano direttamente la precisione di RAG. È necessario aggiornare regolarmente l'indice e configurare gli algoritmi di classificazione affinché il recupero dei documenti rimanga rilevante.
- **Elevata complessità e dispendio di risorse**. Un sistema RAG per funzionare richiede non solo l'LLM stesso, ma anche un'infrastruttura per la ricerca: archiviazione e aggiornamento di un ampio database, indicizzazione, tempo per l'esecuzione delle query. Tutto ciò aumenta i costi computazionali e può ridurre la velocità di risposta rispetto al solo modello linguistico<sup>[\[8\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-brightdata-blog-8)</sup>. Nel peggiore dei casi, i ritardi nella fase di ricerca o l'elaborazione di una quantità molto grande di dati rallenteranno il sistema. In pratica, occorre bilanciare qualità della risposta e prestazioni, ottimizzando la pipeline (ad esempio limitando la dimensione della base di conoscenze o la profondità della ricerca, per mantenere il tempo di risposta entro limiti accettabili).
- **Requisiti sui dati e sulla manutenzione**. Per un funzionamento efficace, RAG necessita di dati esterni **di qualità, strutturati e accessibili**. Il modello di ricerca può avere difficoltà a trovare informazioni utili se la base di conoscenze esterna è poco organizzata o contiene rumore<sup>[\[8\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-brightdata-blog-8)</sup>. Inoltre, non sempre i dati necessari sono aperti o a basso costo: le aziende devono creare e mantenere proprie **knowledge bases**. Ciò genera costi aggiuntivi e richiede sforzi per l'aggiornamento dei dati (ad esempio l'aggiunta di nuovi documenti, la pulizia delle informazioni obsolete). Il punto debole di RAG è la dipendenza dal mantenimento aggiornato della base di conoscenze.
- **Ineliminabilità di alcuni errori degli LLM**. Sebbene RAG riduca significativamente il numero di confabulazioni, non è sempre possibile escludere completamente le **risposte errate**<sup>[\[9\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-failure-points-9)</sup>. Il modello generativo può comunque commettere un errore logico o generalizzare in modo scorretto le informazioni, specialmente se il contesto fornito è insufficiente o contraddittorio<sup>[\[9\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-failure-points-9)</sup>. In effetti, RAG sposta l'accento degli errori: al posto di fatti palesemente inventati («allucinazioni») si riscontrano più spesso **errori di integrazione delle conoscenze** — ad esempio il modello può tralasciare un frammento importante o collegare in modo scorretto fonti diverse tra loro. Pertanto, nelle applicazioni critiche (medicina, diritto) è comunque necessario il coinvolgimento umano per la verifica e la correzione delle risposte del sistema.

## Applicazioni di RAG

Il metodo Retrieval-Augmented Generation ha trovato applicazione in numerosi scenari legati all'estrazione e all'utilizzo delle conoscenze. Di seguito sono elencati i principali ambiti in cui RAG dimostra la maggiore utilità:

- **Sistemi di risposta alle domande** e **chatbot**. RAG consente di creare **assistenti virtuali** e chatbot che rispondono alle domande degli utenti con elevata precisione e possono fornire riferimenti alle fonti. Nel settore del supporto clienti, tali bot accedono alla base di conoscenze interna dell'azienda (FAQ, articoli di supporto) e forniscono risposte immediate alle richieste dei clienti, riducendo il carico sugli operatori<sup>[\[8\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-brightdata-blog-8)</sup>. A differenza dei classici sistemi FAQ, i bot RAG formulano la risposta in un linguaggio naturale, ma la «supportano» con dati aggiornati e specifici per il problema dell'utente.
- **Medicina** e **sanità**. Un modello generativo arricchito con una base di dati medica specializzata (articoli scientifici, protocolli clinici, repertori) può fungere da assistente intelligente per medici o pazienti. Ad esempio, il sistema sarà in grado di rispondere a una domanda su una diagnosi rara, trovando nella letteratura medica le ricerche più recenti sull'argomento<sup>[\[8\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-brightdata-blog-8)</sup>. Un importante vantaggio di RAG in medicina è la possibilità di fare riferimento alle fonti primarie (ad esempio i risultati di sperimentazioni cliniche), indispensabile per la fiducia da parte dei medici. Tali sistemi vengono utilizzati per il supporto alle decisioni, la verifica dei sintomi, la formazione degli studenti di medicina ecc., garantendo l'accesso alle conoscenze mediche più aggiornate.
- **Diritto** e **finanza**. Nella pratica legale e nell'analisi finanziaria sono particolarmente critiche la precisione e la verificabilità delle informazioni. I sistemi RAG possono aiutare i professionisti a trovare rapidamente i dati necessari: ad esempio, un avvocato con l'aiuto del modello troverà e citerà una sentenza precedente o un articolo di legge rilevante per il caso in corso, mentre un analista finanziario otterrà rapidamente estratti da recenti rapporti economici o notizie di mercato<sup>[\[8\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-brightdata-blog-8)</sup>. Ogni risposta del modello può contenere riferimenti a documenti specifici (atti normativi, rapporti, articoli), il che è conforme agli standard del settore e facilita il successivo lavoro manuale dello specialista.
- **Ricerca scientifica** e **creazione di contenuti**. Giornalisti, ricercatori e scrittori possono utilizzare RAG per accelerare la **ricerca di fatti e fonti** nella preparazione dei materiali. Ad esempio, il modello è in grado di «raccogliere» su richiesta informazioni da più pubblicazioni autorevoli, riducendo significativamente il tempo per il fact-checking e la selezione delle citazioni<sup>[\[8\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-brightdata-blog-8)</sup>. Gli assistenti alla ricerca basati su RAG estraggono automaticamente riferimenti a lavori rilevanti, dati da basi aperte (ad esempio statistiche da rapporti internazionali) e persino bozze di traduzioni, consentendo agli autori di concentrarsi sulla parte analitica del lavoro. Strumenti di questo tipo trovano applicazione nei media, in ambito accademico, nella preparazione di rassegne della letteratura ecc.
- **Conoscenze aziendali** e **ricerca nei documenti**. In molte organizzazioni una quantità significativa di informazioni preziose è archiviata sotto forma di documenti testuali: regolamenti, manuali, rapporti, corrispondenza, file di log. RAG fornisce un metodo di **ricerca interattiva** in tali dati non strutturati tramite linguaggio naturale. Un dipendente può porre una domanda («Cosa prevede la politica sulle ferie per i dipendenti da remoto?») — e il modello troverà la sezione pertinente del documento interno, la citerà e formulerà una risposta riassuntiva<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>. Ciò aumenta l'efficienza lavorativa: i nuovi dipendenti trovano più rapidamente le risposte alle loro domande, i reparti di supporto ottengono uno strumento per la ricerca rapida nella base degli incidenti, e il management dispone di un modo per analizzare i dati testuali accumulati. Le grandi aziende IT stanno già implementando l'approccio RAG nelle soluzioni aziendali: le tecnologie di Microsoft, Google, IBM, AWS e altri integrano gli LLM con la ricerca sui dati dell'organizzazione<sup>[\[1\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-nvidia-blog-1)</sup>.

## Prospettive e ricerche future

Il metodo Retrieval-Augmented Generation è in continua evoluzione e nei prossimi anni si prevede un'ulteriore espansione delle sue capacità. Una delle direzioni è il **RAG multimodale**, in cui come informazione esterna possono essere utilizzati non solo testi, ma anche immagini, audio/video o persino dati provenienti da sensori. Gli esperimenti mostrano le prospettive della combinazione di modelli linguistici con la ricerca su basi di dati visive, il che consentirà ad esempio di rispondere a domande sul contenuto di immagini o video basandosi su descrizioni e testi correlati<sup>[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup>. Un'altra direzione importante è l'utilizzo simultaneo di **più fonti di conoscenza**: i futuri sistemi RAG potranno combinare dati provenienti da basi diverse (ad esempio Wikipedia, enciclopedie specializzate, note personali dell'utente) e sintetizzare risposte tenendo conto di tutte queste informazioni eterogenee<sup>[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup>.

I ricercatori devono affrontare anche il compito di aumentare l'affidabilità e la sicurezza di RAG. È necessario minimizzare il rischio di propagazione di pregiudizi ed errori che possono essere contenuti nei dati esterni, nonché garantire la coerenza delle risposte. Il team degli sviluppatori del RAG originale ha già compiuto passi in questa direzione — ad esempio, limitando la base di conoscenze iniziale ai soli articoli di Wikipedia come fonte relativamente verificata e neutrale<sup>[\[2\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-venturebeat-facebook-2)</sup>. In futuro si prevede di creare filtri speciali e metodi di selezione dei documenti, affinché il modello riceva un contesto di qualità garantita. Inoltre, le ricerche si concentrano sul miglioramento del meccanismo di ricerca stesso: vengono sviluppati nuovi algoritmi di **classificazione** e **indicizzazione semantica**, capaci di comprendere le query con maggiore precisione e trovare informazioni rilevanti anche su formulazioni complesse o imprecise.

Infine, di grande interesse è una più profonda integrazione di RAG con il processo di addestramento dei modelli linguistici. Stanno già emergendo approcci in cui i meccanismi di retrieval vengono utilizzati non solo nella fase di inferenza, ma anche durante il pre-addestramento o il fine-tuning degli LLM<sup>[\[10\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-wikipedia-ru-rag-10)</sup>. Ciò potrebbe aumentare ulteriormente la fattualità dei modelli e ridurne la dipendenza dalle conoscenze staticamente codificate nei pesi. Secondo le rassegne pubblicate nel 2024, la comunità vede grandi prospettive nello sviluppo dell'ecosistema RAG: dall'ottimizzazione dell'infrastruttura (accelerazione della ricerca, riduzione dei costi di memoria) alla creazione di benchmark standard per la valutazione della qualità dei sistemi RAG<sup>[\[3\]](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_note-arxiv-survey-3)</sup>. Tutto ciò mira a rendere i modelli generativi più precisi, versatili e sicuri nel lavorare con conoscenze esterne in continuo aggiornamento, il che rappresenta un passo fondamentale verso un'intelligenza artificiale affidabile di nuova generazione.

## Riferimenti

- Cos'è il Retrieval-Augmented Generation (RAG) — blog NVIDIA
- Retrieval-Augmented Generation for Large Language Models: A Survey — rassegna scientifica su arXiv
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — articolo originale su RAG
- Cos'è RAG? Applicazioni, limitazioni e sfide — blog Bright Data

## Bibliografia

- Lewis, P. et al. (2020). *Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks*. arXiv:2005.11401.
- Karpukhin, V. et al. (2020). *Dense Passage Retrieval for Open-Domain Question Answering*. arXiv:2004.04906.
- Guu, K. et al. (2020). *REALM: Retrieval-Augmented Language Model Pre-Training*. arXiv:2002.08909.
- Qu, Y. et al. (2020). *RocketQA: An Optimized Training Approach to Dense Passage Retrieval for Open-Domain Question Answering*. arXiv:2010.08191.
- Izacard, G.; Grave, E. (2021). *Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering*. arXiv:2007.01282.
- Borgeaud, S. et al. (2022). *Improving Language Models by Retrieving from Trillions of Tokens*. arXiv:2112.04426.
- Wei, J. et al. (2022). *Chain of Thought Prompting Elicits Reasoning in Large Language Models*. arXiv:2201.11903.
- Wang, X. et al. (2022). *Self-Consistency Improves Chain of Thought Reasoning in Language Models*. arXiv:2203.11171.
- Kojima, T. et al. (2022). *Large Language Models are Zero-Shot Reasoners*. arXiv:2205.11916.
- Yao, S. et al. (2022). *ReAct: Synergizing Reasoning and Acting in Language Models*. arXiv:2210.03629.
- Mialon, G. et al. (2023). *Retrieval-Augmented Generation for Large Language Models: A Survey*. arXiv:2312.10997.
- Madaan, A. et al. (2023). *Self-Refine: Iterative Refinement with Self-Feedback*. arXiv:2303.17651.
- Yang, Z. et al. (2023). *Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning*. arXiv:2302.04858.
- Barnett, S. et al. (2024). *Seven Failure Points When Engineering a Retrieval Augmented Generation System*. arXiv:2401.05856.
- Wang, Y. et al. (2024). *Self-Instruct: Aligning Language Models with Self-Generated Instructions*. arXiv:2212.10560.
- Han, H. et al. (2025). *Retrieval-Augmented Generation with Graphs (GraphRAG)*. arXiv:2501.00309.

## Note

1.  <span id="cite_note-nvidia-blog-1">↑ <sup>[1.00](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-nvidia-blog_1-12)</sup> «What Is Retrieval-Augmented Generation aka RAG». *NVIDIA Blogs*. <a href="https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-venturebeat-facebook-2">↑ <sup>[2.00](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-venturebeat-facebook_2-10)</sup> «Facebook open-sources RAG, an AI model that retrieves documents to answer questions». *VentureBeat*. <a href="https://venturebeat.com/ai/facebook-open-sources-rag-an-ai-model-that-retrieves-documents-to-answer-questions/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-survey-3">↑ <sup>[3.0](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-survey_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-survey_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-survey_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-survey_3-3)</sup> Mialon, Grégoire et al. «Retrieval-Augmented Generation for Large Language Models: A Survey». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2312.10997" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-pragmaticengineer-rag-4">↑ <sup>[4.0](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-pragmaticengineer-rag_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-pragmaticengineer-rag_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-pragmaticengineer-rag_4-2)</sup> «Applied AI Software Engineering: RAG». *Pragmatic Engineer*. <a href="https://newsletter.pragmaticengineer.com/p/rag" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-original-5">↑ <sup>[5.0](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-original_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-original_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-original_5-2)</sup> Lewis, Patrick et al. «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks». *arXiv*. <a href="https://arxiv.org/abs/2005.11401" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-exxact-blog-6">↑ <sup>[6.0](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-exxact-blog_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-exxact-blog_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-exxact-blog_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-exxact-blog_6-3)</sup> <sup>[6.4](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-exxact-blog_6-4)</sup> <sup>[6.5](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-exxact-blog_6-5)</sup> <sup>[6.6](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-exxact-blog_6-6)</sup> «How RAG Makes LLMs Smarter». *Exxact Blog*. <a href="https://www.exxactcorp.com/blog/deep-learning/how-retrieval-augment-generation-makes-llms-smarter-than-before" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-arxiv-original-pdf-7">[↑](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-original-pdf_7-0) «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks». *arXiv*. <a href="https://arxiv.org/pdf/2005.11401" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-brightdata-blog-8">↑ <sup>[8.0](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-brightdata-blog_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-brightdata-blog_8-1)</sup> <sup>[8.2](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-brightdata-blog_8-2)</sup> <sup>[8.3](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-brightdata-blog_8-3)</sup> <sup>[8.4](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-brightdata-blog_8-4)</sup> <sup>[8.5](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-brightdata-blog_8-5)</sup> <sup>[8.6](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-brightdata-blog_8-6)</sup> <sup>[8.7](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-brightdata-blog_8-7)</sup> <sup>[8.8](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-brightdata-blog_8-8)</sup> «What Is RAG? Use Cases, Limitations, and Challenges». *Bright Data Blog*. <a href="https://brightdata.com/blog/web-data/rag-explained" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-arxiv-failure-points-9">↑ <sup>[9.0](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-failure-points_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-failure-points_9-1)</sup> <sup>[9.2](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-arxiv-failure-points_9-2)</sup> Lewis, Patrick et al. «Seven Failure Points When Engineering a Retrieval Augmented Generation System». *arXiv*. <a href="https://arxiv.org/html/2401.05856v1" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-wikipedia-ru-rag-10">[↑](https://systems-analysis.info/int/Retrieval-augmented_generation_(RAG)_(IT)#cite_ref-wikipedia-ru-rag_10-0) «Генерация, дополненная поиском». *Википедия*. <a href="https://ru.wikipedia.org/wiki/%D0%93%D0%B5%D0%BD%D0%B5%D1%80%D0%B0%D1%86%D0%B8%D1%8F_%D0%B4%D0%BE%D0%BF%D0%BE%D0%BB%D0%BD%D0%B5%D0%BD%D0%BD%D0%B0%D1%8F_%D0%BF%D0%BE%D0%B8%D1%81%D0%BA%D0%BE%D0%BC" class="external autonumber" rel="nofollow">[10]</a></span>
