Un large language model, in italiano modello linguistico di grandi dimensioni e spesso abbreviato in LLM, è un modello statistico addestrato su grandi quantità di testo per prevedere quale elemento linguistico sia più probabile in una determinata posizione. Da questa capacità apparentemente semplice derivano comportamenti complessi: rispondere a domande, riassumere un documento, tradurre, riformulare o produrre codice.

L’aggettivo «grande» si riferisce a due dimensioni contemporaneamente: la quantità di testo impiegata nell’addestramento e il numero di parametri del modello, cioè i valori numerici che ne descrivono il comportamento appreso. Al crescere di entrambe, questi sistemi hanno mostrato capacità che non erano state programmate in modo esplicito, come seguire istruzioni formulate in linguaggio naturale senza un addestramento dedicato a ogni singolo compito.

Come funziona un large language model

Il testo in ingresso viene suddiviso in unità minime chiamate token, che possono corrispondere a una parola intera, a una parte di parola o a un segno di punteggiatura. Ogni token viene convertito in un vettore numerico e il modello calcola, per la posizione successiva, una distribuzione di probabilità su tutti i token possibili. La risposta viene costruita ripetendo questo passaggio fino al termine.

Token e finestra di contesto

La finestra di contesto è la quantità massima di token che il modello può considerare contemporaneamente, comprendendo sia la richiesta sia la risposta in corso di produzione. Tutto ciò che eccede questo limite non viene preso in esame: è la ragione per cui, in conversazioni molto lunghe o su documenti estesi, le informazioni iniziali possono risultare assenti dal ragionamento del modello.

Attenzione e relazioni fra le parole

I modelli attuali si basano su un meccanismo che consente di pesare la rilevanza reciproca dei token presenti nel contesto, indipendentemente dalla loro distanza nel testo. È questo che permette a un modello di collegare un pronome al nome corretto citato molte righe prima, o di mantenere coerente il soggetto di un discorso articolato.

Le fasi di costruzione di un modello linguistico

FaseChe cosa avvieneRisultato
Pre-addestramentoIl modello elabora grandi quantità di testo prevedendo elementi mancantiConoscenza linguistica generale
Messa a puntoAddestramento su esempi di compiti specifici o su istruzioniCapacità di seguire richieste
AllineamentoCorrezione del comportamento sulla base di preferenze umaneRisposte più utili e prevedibili

Limiti di un large language model

Un modello linguistico ottimizza la plausibilità del testo, non la sua verità. Ne derivano limiti strutturali che nessuna formulazione della richiesta elimina del tutto.

Conoscenza ferma nel tempo

I parametri riflettono i dati disponibili al momento dell’addestramento. Un evento successivo non è noto al modello, a meno che il sistema non recuperi informazioni aggiornate da una fonte esterna al momento della richiesta. Questa distinzione fra conoscenza interna e documento recuperato è essenziale per valutare l’attendibilità di una risposta.

Assenza di verifica interna

Il modello non dispone di un meccanismo che confronti l’affermazione prodotta con una base di fatti. Un’informazione errata viene generata con la stessa sicurezza espressiva di una corretta, e la fluidità del testo non costituisce un indizio di accuratezza.

Come si sceglie un modello linguistico

Ogni richiesta comporta un calcolo proporzionale alla quantità di token elaborati, in ingresso e in uscita. Ne deriva che un contesto molto ampio non è soltanto un vantaggio: aumenta il tempo di risposta e il costo dell’operazione. Per questa ragione convivono modelli di dimensioni diverse, impiegati in base al compito: un modello ridotto può risultare preferibile per operazioni semplici e ripetitive, mentre uno più grande viene riservato ai casi che richiedono ragionamenti articolati. La scelta è quindi un compromesso fra accuratezza attesa, latenza e costo, non una semplice preferenza per il modello più capace disponibile.

  1. Definire il compito e il livello di accuratezza realmente necessario.
  2. Stimare il volume di richieste previsto e la lunghezza media dei testi trattati.
  3. Confrontare i candidati sugli stessi esempi reali, non su prove generiche.
  4. Misurare tempo di risposta e costo per richiesta insieme alla qualità.
  5. Riservare il modello più capace ai casi che lo giustificano.

Large language model e ricerca online

I modelli linguistici sono oggi integrati sia negli assistenti conversazionali sia nelle funzioni di risposta dei motori di ricerca. Per chi produce contenuti questo significa che un testo può essere elaborato da un sistema automatico come fonte di una sintesi. Definizioni esplicite, struttura ordinata dei titoli e affermazioni verificabili rendono un contenuto più facile da interpretare correttamente, mentre i testi ambigui o costruiti attorno a formule promozionali offrono meno elementi utilizzabili.

Per una trattazione enciclopedica del tema si può consultare la voce Modello linguistico di grandi dimensioni su Wikipedia.

Domande frequenti sui large language model

Un large language model comprende davvero ciò che scrive?

Elabora relazioni statistiche fra elementi linguistici e non possiede una comprensione nel senso umano del termine. Il risultato può essere corretto e pertinente senza che vi sia consapevolezza del significato.

Che cosa sono i parametri di un modello?

Sono i valori numerici regolati durante l’addestramento, che determinano come il modello trasforma l’input in output. Il loro numero indica la capacità del modello, non la qualità delle risposte.

Perché il modello non conosce gli eventi recenti?

Perché la sua conoscenza interna è fissata al momento dell’addestramento. Per informazioni aggiornate il sistema deve recuperarle da una fonte esterna durante la richiesta.

Una finestra di contesto più ampia elimina gli errori?

No. Riduce la perdita di informazioni in testi lunghi, ma non introduce alcun controllo sull’esattezza di ciò che viene generato.

Large language model e chatbot sono la stessa cosa?

No. Il modello è il componente che genera il testo; il chatbot è l’applicazione che lo espone attraverso un’interfaccia di conversazione, spesso aggiungendo memoria, strumenti e regole di sicurezza.