L’apprendimento non supervisionato è una modalità di apprendimento automatico in cui un algoritmo analizza un insieme di dati privi di etichette o di risposte predefinite, allo scopo di individuarne la struttura intrinseca, le regolarità e le relazioni nascoste. A differenza dell’apprendimento supervisionato, dove il modello viene addestrato su esempi già classificati, in questo caso non esiste un obiettivo esplicito da raggiungere: il sistema non riceve indicazioni su quale sia la risposta corretta per ciascun dato.
Questa caratteristica rende l’apprendimento non supervisionato particolarmente adatto a contesti in cui etichettare i dati risulta costoso, lento o addirittura impossibile. Il suo scopo principale è esplorativo: raggruppare elementi simili, ridurre la complessità delle informazioni, rilevare anomalie o comprimere i dati in rappresentazioni più compatte. Si tratta di una delle aree fondamentali dell’intelligenza artificiale e della statistica computazionale.
Come funziona l’apprendimento non supervisionato
Il punto di partenza è sempre un insieme di dati grezzi, rappresentati come vettori di caratteristiche numeriche o categoriche. L’algoritmo cerca di organizzare questi dati secondo un criterio di similarità, senza che nessuno gli abbia detto in anticipo quante categorie esistano o come debbano essere chiamate. Il risultato non è una previsione etichettata, ma una struttura: gruppi, mappe, componenti principali o distribuzioni di probabilità.
Poiché non esiste una risposta corretta di riferimento, valutare la qualità di un risultato non supervisionato è più complesso rispetto all’apprendimento supervisionato. Si ricorre spesso a misure interne, come la coesione dei gruppi o la separazione tra essi, oppure a una valutazione umana basata sull’interpretabilità dei risultati ottenuti.
Principali tecniche utilizzate
Clustering
Il clustering consiste nel raggruppare osservazioni simili all’interno di insiemi omogenei chiamati cluster. Algoritmi noti come k-means, clustering gerarchico e DBSCAN permettono di segmentare i dati in base alla distanza tra i punti. È impiegato, ad esempio, nella segmentazione della clientela o nell’analisi di documenti testuali.
Riduzione della dimensionalità
Questa famiglia di tecniche trasforma dati con molte variabili in rappresentazioni con meno dimensioni, conservando quante più informazioni possibili. L’analisi delle componenti principali e gli autoencoder sono approcci diffusi. La riduzione della dimensionalità facilita la visualizzazione e velocizza le elaborazioni successive.
Rilevamento di anomalie
Il rilevamento di anomalie identifica osservazioni che si discostano in modo significativo dal comportamento tipico del dataset. Poiché spesso non si dispone di esempi etichettati di anomalie, si modella la normalità dei dati e si segnalano le deviazioni. Trova applicazione nella sicurezza informatica e nel controllo dei processi industriali.
Regole di associazione
Le regole di associazione individuano relazioni ricorrenti tra elementi che compaiono insieme. L’esempio classico è l’analisi del carrello della spesa, dove si scoprono prodotti acquistati congiuntamente. L’algoritmo Apriori è uno dei metodi storici per estrarre questo tipo di regolarità.
Confronto con altre forme di apprendimento
| Aspetto | Non supervisionato | Supervisionato | Per rinforzo |
|---|---|---|---|
| Dati di input | Senza etichette | Con etichette | Interazione con ambiente |
| Obiettivo | Scoprire struttura | Prevedere un valore | Massimizzare una ricompensa |
| Feedback | Nessuna risposta corretta | Errore rispetto all’etichetta | Ricompensa o penalità |
| Esempio tipico | Segmentazione clienti | Classificazione di immagini | Controllo di un robot |
| Valutazione | Spesso qualitativa | Metriche di accuratezza | Punteggio cumulato |
Applicazioni pratiche
L’apprendimento non supervisionato alimenta numerosi sistemi di uso quotidiano. Nei motori di raccomandazione contribuisce a raggruppare utenti con gusti simili; nella bioinformatica aiuta a individuare pattern in dati genetici; nel marketing consente di segmentare il pubblico in base a comportamenti osservati. Anche la compressione delle immagini e la ricerca di similarità tra testi sfruttano tecniche di riduzione della dimensionalità.
Un ulteriore impiego riguarda l’analisi esplorativa dei dati, fase preliminare in cui si cerca di comprendere la natura di un dataset prima di costruire modelli più specifici. In questo senso, l’apprendimento non supervisionato funge spesso da strumento di supporto per successive attività supervisionate.
Vantaggi, limiti e passi di un progetto
Il principale vantaggio risiede nell’assenza di etichette, che riduce drasticamente i costi di preparazione dei dati. Il limite più evidente è invece la difficoltà di valutare e interpretare i risultati, che possono dipendere da scelte arbitrarie come il numero di cluster o la misura di distanza adottata. Di seguito i passi tipici di un progetto non supervisionato.
- Definire l’obiettivo esplorativo e le domande a cui si vuole rispondere.
- Raccogliere e pulire i dati, gestendo valori mancanti e outlier.
- Selezionare e normalizzare le caratteristiche più informative.
- Scegliere l’algoritmo adatto, ad esempio clustering o riduzione della dimensionalità.
- Impostare i parametri principali, come il numero di gruppi attesi.
- Eseguire l’algoritmo e ottenere la struttura dei dati.
- Valutare i risultati con misure interne e con l’interpretazione umana.
- Comunicare le conclusioni e decidere eventuali approfondimenti.
Domande frequenti
Qual è la differenza principale con l’apprendimento supervisionato?
Nell’apprendimento supervisionato i dati sono accompagnati da etichette corrette, mentre in quello non supervisionato le etichette sono assenti e l’algoritmo deve scoprire da sé la struttura del dataset.
L’apprendimento non supervisionato produce sempre risultati utili?
No, la qualità dipende dai dati, dalla scelta dell’algoritmo e dai parametri. Senza etichette di riferimento è più difficile capire se i gruppi individuati abbiano un significato reale.
Che cos’è un cluster?
Un cluster è un insieme di osservazioni che risultano simili tra loro secondo una misura di distanza o di similarità scelta dall’analista.
Quali sono gli algoritmi più conosciuti?
Tra i più noti vi sono k-means e il clustering gerarchico per il raggruppamento, l’analisi delle componenti principali per la riduzione della dimensionalità e Apriori per le regole di associazione.
Serve conoscere in anticipo il numero di gruppi?
Alcuni algoritmi, come k-means, richiedono di specificare il numero di cluster prima dell’esecuzione. Altri, come DBSCAN, lo determinano automaticamente in base alla densità dei dati.
In quali settori viene impiegato maggiormente?
È usato nel marketing per la segmentazione, nella sicurezza informatica per il rilevamento di anomalie, nella bioinformatica e nei sistemi di raccomandazione, oltre che nell’analisi esplorativa dei dati.
