L’apprendimento supervisionato è una delle principali modalità di addestramento utilizzate nell’ambito dell’intelligenza artificiale e dell’apprendimento automatico. In questo paradigma, un modello viene istruito a partire da un insieme di dati etichettati, cioè da esempi in cui a ciascun valore di ingresso è associata una risposta desiderata. L’obiettivo è che il modello impari una regola generale in grado di collegare gli ingressi alle uscite corrette, così da poter formulare previsioni accurate su dati mai visti prima.

La logica dell’apprendimento supervisionato ricorda il modo in cui uno studente impara sotto la guida di un insegnante: ogni esercizio è accompagnato dalla soluzione, e l’allievo corregge progressivamente i propri errori fino a raggiungere un buon livello di autonomia. Nel contesto informatico, la “supervisione” è rappresentata dalle etichette presenti nei dati di addestramento, che indicano al modello quale dovrebbe essere il risultato atteso per ogni esempio fornito.

Come funziona l’apprendimento supervisionato

Il processo inizia con la raccolta e la preparazione di un insieme di dati etichettati. Ogni esempio è composto da una serie di caratteristiche, dette anche attributi o variabili di ingresso, e da un’etichetta che rappresenta la risposta corretta. Il modello viene quindi addestrato iterativamente: a ogni passo confronta la propria previsione con l’etichetta reale e calcola un errore, che viene utilizzato per aggiornare i parametri interni del modello stesso.

Questo ciclo di previsione, confronto e correzione si ripete molte volte fino a quando l’errore si riduce a un livello accettabile. Al termine dell’addestramento, il modello viene valutato su un insieme di dati separato, detto di test, che non è stato utilizzato durante la fase di apprendimento. In questo modo si verifica la capacità del modello di generalizzare, cioè di fornire risposte corrette anche su esempi nuovi.

Le due tipologie principali di problemi

Nell’apprendimento supervisionato si distinguono due grandi famiglie di problemi, che dipendono dal tipo di etichetta associata ai dati. Comprendere questa distinzione è fondamentale per scegliere l’algoritmo e le metriche di valutazione più adatti.

Classificazione

Nella classificazione, l’etichetta appartiene a un insieme finito di categorie discrete. Il modello deve assegnare ogni esempio a una classe specifica, come “spam” o “non spam”, oppure riconoscere la cifra scritta in un’immagine. Le classi possono essere due, nel caso della classificazione binaria, oppure molteplici, nel caso della classificazione multiclasse.

Regressione

Nella regressione, l’etichetta è un valore numerico continuo. Il modello deve stimare una grandezza quantitativa, come il prezzo di un immobile in base alla sua superficie e alla sua posizione, oppure la temperatura prevista per una determinata giornata. In questi casi la valutazione si basa sulla distanza tra il valore previsto e quello reale.

Algoritmi e modelli più diffusi

Esistono numerosi algoritmi utilizzabili nell’apprendimento supervisionato, ciascuno con caratteristiche, vantaggi e limiti specifici. La scelta dipende dalla natura del problema, dalla quantità e dalla qualità dei dati disponibili, nonché dalle risorse computazionali a disposizione.

Tra gli approcci più noti si trovano la regressione lineare e la regressione logistica, gli alberi decisionali, le macchine a vettori di supporto, i metodi basati sugli insiemi come le foreste casuali e il potenziamento del gradiente, e le reti neurali artificiali, che negli ultimi anni hanno ottenuto risultati rilevanti in ambiti come il riconoscimento delle immagini e l’elaborazione del linguaggio naturale.

Confronto tra apprendimento supervisionato e non supervisionato

Per comprendere meglio il ruolo dell’apprendimento supervisionato è utile confrontarlo con il paradigma non supervisionato, in cui i dati non sono etichettati. La tabella seguente riassume le differenze principali.

AspettoApprendimento supervisionatoApprendimento non supervisionato
Dati di ingressoEtichettati con la risposta attesaPrivi di etichette
ObiettivoPrevedere un’uscita correttaScoprire strutture o raggruppamenti nascosti
Esempi di compitiClassificazione e regressioneRaggruppamento e riduzione della dimensionalità
ValutazioneConfronto diretto con le etichette realiValutazione più qualitativa e interpretativa
Necessità di annotazioneElevata, richiede dati etichettatiBassa, non richiede etichette

Fasi di un progetto di apprendimento supervisionato

Un progetto tipico segue una sequenza di passaggi ben definiti, che vanno dalla comprensione del problema alla messa in produzione del modello. Di seguito sono elencate le fasi principali.

  1. Definizione chiara dell’obiettivo e del tipo di previsione richiesta.
  2. Raccolta dei dati necessari e verifica della loro qualità e completezza.
  3. Pulizia e preparazione dei dati, con gestione dei valori mancanti e delle anomalie.
  4. Etichettatura degli esempi, quando le etichette non sono già disponibili.
  5. Suddivisione dei dati in insiemi di addestramento, validazione e test.
  6. Scelta dell’algoritmo e addestramento del modello sui dati di addestramento.
  7. Valutazione delle prestazioni e ottimizzazione dei parametri.
  8. Messa in produzione del modello e monitoraggio nel tempo.

Vantaggi e limiti

Il principale vantaggio dell’apprendimento supervisionato risiede nella sua capacità di produrre previsioni precise quando sono disponibili dati etichettati di buona qualità e in quantità sufficiente. Esso consente inoltre di misurare in modo oggettivo le prestazioni del modello, poiché le risposte corrette sono note.

Il limite più evidente è rappresentato proprio dalla necessità di etichette: l’annotazione manuale dei dati può essere costosa, lenta e soggetta a errori. Inoltre, un modello addestrato su un insieme di dati poco rappresentativo può faticare a generalizzare e tendere alla sovradattazione, cioè a memorizzare gli esempi di addestramento senza cogliere le regolarità sottostanti.

Domande frequenti

Che cos’è l’apprendimento supervisionato in parole semplici?

È un metodo con cui un modello impara da esempi già accompagnati dalla risposta corretta, così da riuscire a rispondere correttamente anche a nuovi casi mai visti.

Qual è la differenza tra classificazione e regressione?

Nella classificazione l’uscita è una categoria discreta, mentre nella regressione l’uscita è un valore numerico continuo.

Perché servono i dati etichettati?

Le etichette rappresentano la risposta attesa e permettono al modello di calcolare l’errore e di correggere progressivamente i propri parametri durante l’addestramento.

Che cosa significa sovradattazione?

È la tendenza del modello a memorizzare i dati di addestramento invece di apprendere regole generali, con conseguenti prestazioni scarse su dati nuovi.

Quali sono alcuni algoritmi comuni?

Tra i più diffusi vi sono la regressione lineare, la regressione logistica, gli alberi decisionali, le macchine a vettori di supporto e le reti neurali artificiali.

In quali ambiti viene utilizzato?

Trova applicazione in molti settori, come il riconoscimento delle immagini, il filtraggio dei messaggi indesiderati, la previsione di valori finanziari e la diagnosi medica assistita.