La retrieval augmented generation, abbreviata in RAG, è una tecnica che collega un modello generativo a una fonte documentale esterna: prima di produrre la risposta, il sistema recupera i documenti pertinenti alla richiesta e li fornisce al modello come contesto da utilizzare. La generazione avviene quindi a partire da materiale consultato in quel momento, e non soltanto dalla conoscenza fissata durante l’addestramento.
L’approccio nasce per rispondere a un limite preciso dei modelli linguistici: la loro conoscenza interna è ferma al periodo di addestramento e non è riconducibile a documenti identificabili. Collegando il modello a un archivio aggiornato diventa possibile rispondere su informazioni recenti o riservate a un’organizzazione, e soprattutto indicare da quale documento proviene ciò che è stato affermato.
Come funziona la retrieval augmented generation
Il meccanismo separa due responsabilità: il recupero, che individua i testi rilevanti, e la generazione, che li trasforma in una risposta leggibile. Il modello non deve ricordare il contenuto, ma saperlo leggere e sintetizzare correttamente.
Indicizzazione dei documenti
I documenti vengono suddivisi in porzioni di dimensione gestibile e convertiti in rappresentazioni numeriche che ne descrivono il significato. Queste rappresentazioni sono conservate in un archivio che consente di individuare rapidamente i testi semanticamente vicini a una domanda, anche quando non contengono le stesse parole impiegate nella richiesta.
Recupero e costruzione della risposta
Alla ricezione della domanda il sistema la converte nello stesso formato numerico, seleziona le porzioni di documento più affini e le inserisce nel contesto insieme alla richiesta originale. Il modello riceve quindi un’istruzione che comprende sia la domanda sia il materiale su cui fondarla, e produce la risposta lavorando su quel materiale.
Le fasi di una pipeline RAG
- Raccogliere i documenti da rendere consultabili e normalizzarne il formato.
- Suddividerli in porzioni coerenti, evitando tagli che spezzino il significato.
- Calcolare le rappresentazioni numeriche di ciascuna porzione e archiviarle.
- Recuperare, per ogni domanda, le porzioni più pertinenti.
- Comporre il contesto da passare al modello insieme alla richiesta.
- Generare la risposta e collegarla ai documenti effettivamente utilizzati.
Che cosa risolve e che cosa non risolve
| Problema | Effetto della RAG |
|---|---|
| Conoscenza non aggiornata | Superato: i documenti sono consultati al momento della richiesta |
| Assenza di fonti citabili | Superato: la risposta può rinviare ai documenti recuperati |
| Informazioni riservate o interne | Superato senza riaddestrare il modello |
| Affermazioni inesatte | Ridotto ma non eliminato: dipende dalla qualità del recupero |
| Documenti di partenza errati | Non risolto: l’errore viene riportato nella risposta |
Limiti della retrieval augmented generation
Quando il recupero non trova il documento giusto
La qualità complessiva dipende in misura decisiva dalla fase di recupero. Se le porzioni selezionate non contengono l’informazione necessaria, il modello tende comunque a produrre una risposta, colmando il vuoto con la propria conoscenza interna: il risultato appare fondato su documenti mentre in parte non lo è. Anche la suddivisione dei testi incide, perché porzioni troppo brevi perdono il contesto e porzioni troppo lunghe introducono materiale irrilevante.
Qualità e manutenzione dell’archivio
Un secondo limite riguarda l’archivio: un documento obsoleto o inesatto viene trattato come attendibile. La manutenzione della fonte è quindi parte integrante del sistema, non un’attività accessoria. L’impostazione originale della tecnica è descritta nello studio Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, che ne ha introdotto la denominazione.
Valutare un sistema RAG
Poiché le due fasi possono fallire in modo indipendente, la valutazione va condotta separatamente. Sul recupero si verifica se le porzioni restituite contengono effettivamente l’informazione richiesta: un archivio può possedere il documento giusto e non riuscire a selezionarlo, per esempio quando la domanda usa un lessico diverso da quello del testo. Sulla generazione si controlla se la risposta resta ancorata al materiale fornito oppure introduce elementi che nei documenti non compaiono.
Da questa distinzione discende una pratica utile: conservare traccia delle porzioni impiegate per ciascuna risposta. Il collegamento fra affermazione e documento consente di ricostruire l’origine di un errore e di stabilire se vada corretto l’archivio, la suddivisione dei testi o il criterio di selezione. Senza questa tracciabilità il sistema resta difficile da migliorare, perché ogni risposta errata appare indistintamente come un difetto del modello.
Domande frequenti sulla retrieval augmented generation
La RAG è un’alternativa alla messa a punto del modello?
Risponde a esigenze diverse. La messa a punto modifica il comportamento del modello, la RAG gli fornisce informazioni; per aggiungere conoscenza aggiornata la seconda è in genere più adatta ed economica.
La RAG elimina le risposte inventate?
No. Le riduce, ma se il recupero non restituisce il documento utile il modello può ugualmente produrre un’affermazione non sostenuta dalle fonti citate.
Serve un archivio molto grande?
Non necessariamente. Conta la pertinenza dei documenti rispetto alle domande attese: un archivio ridotto ma curato produce risultati migliori di una raccolta ampia e disomogenea.
Perché i documenti vengono suddivisi in porzioni?
Perché il contesto del modello ha una capacità limitata e perché il recupero risulta più preciso su unità brevi e tematicamente coerenti rispetto a documenti interi.
La RAG richiede di riaddestrare il modello quando i dati cambiano?
No. È sufficiente aggiornare l’archivio dei documenti e le relative rappresentazioni numeriche, mentre il modello resta invariato.
