In questo articolo vediamo facciamo una guida sull’apprendimento nel Machine Learning, studiandone gli scopi di apprendimento (regressione, classificazione e clustering) e le modalità di apprendimento (supervisionato e non supervisionato).

In uno dei nostri precedenti articoli abbiamo parlato di cosa sia il Machine Learning, definendolo come un insieme di tecniche che permettono ai computer di apprendere in modo automatico da un set di dati sfruttando una serie di sofisticati algoritmi (per leggere l’articolo clicca qui).
Ma come avviene il processo di apprendimento nel Machine Learning? E cosa possiamo predire?
Ci sono due aspetti da tenere in considerazione quando parliamo dell’apprendimento automatico, due aspetti complementari e paralleli: uno fa riferimento allo scopo di apprendimento, l’altro alla modalità di apprendimento.
Scopi di apprendimento
Lo scopo dell’apprendimento è fondamentale per capire quali tecniche usare. Bisogna capire la tipologia di ciò che vogliamo predire per applicare i giusti algoritmi ed avere quindi un risultato corretto.
Dobbiamo porci la domanda: di che tipo è il valore di ciò che vogliamo predire?
In base alla risposta a questa domanda, quindi al valore che vogliamo predire, abbiamo una serie di possibili aree di analisi:
regressione
Se ciò che vogliamo predire è una variabile numerica continua, ovvero un numero che rappresenta un’entità matematica e che può avere un infinito numero di valori, l’area di analisi è quella della regressione.
Casi di regressione sono per esempio le predizioni su quanto incasserà il nuovo film di Star Wars, l’altezza delle persone in base ad una serie di caratteristiche, il prezzo di una casa.
classificazione
Se ciò che vogliamo predire è una variabile di tipo categorico, ovvero può assumere solo una serie finita di valori, l’area di analisi è la classificazione.
La classificazione può essere di tipo binario (solo due possibili valori, come sì o no oppure 0 e 1), oppure multi-classe, per esempio A, B e C, oppure Pinguino, Pollo, Bradipo.
I contesti in cui posso utilizzare la classificazione possono essere molteplici. Possiamo per esempio predire se un cliente abbandonerà o meno la nostra compagnia, quale genere di film proiettare nel nostro cinema o il titolo di studio di una persona.
clustering
Infine, se l’obiettivo dell’analisi è quello di dividere le nostre osservazioni in gruppi, siamo nel campo del clustering.
Il clustering infatti è un raggruppamento, ed è diverso dalla classificazione. Nella classificazione noi raggruppiamo in base a categorie che già sappiamo a priori, mentre nel clustering io non so quali saranno questi raggruppamenti, so solo che certi individui per una serie di caratteristiche sono simili e possono essere raggruppati insieme.
Il clustering è molto utilizzato nel marketing in quanto permette di personalizzare le offerte in base ai cluster di clienti.
Modalità di apprendimento nel Machine Learning
Regressione, classificazione e clustering… Ma come facciamo a predire il valore che ci interessa?
Il processo attraverso il quale gli algoritmi che utilizziamo imparano qualcosa dai dati è chiamato training. In questa fase sono possibili due principali modalità di apprendimento: apprendimento supervisionato e apprendimento non supervisionato.
apprendimento supervisionato
Nell’apprendimento supervisionato si studiano le relazioni che intercorrono tra una serie di variabili (nel gergo chiamate features) e una variabile che rappresenta l’oggetto della nostra predizione (chiamata target).
Il nostro algoritmo imparerà dai dati la relazione tra features e target e sarà in grado di predire il valore di una target a partire da delle caratteristiche di input. E’ il caso che abbiamo visto precedentemente della regressione e della classificazione: da un set di dati io so che chi si è comportato in un certo modo (quindi ha delle certe features) ha abbandonato la compagnia.
Quello che farà l’algoritmo sarà individuare queste caratteristiche, capire come si relazionano con la target, ed essere in grado di indovinare se un cliente abbandonerà o meno se io gli presentassi un set di caratteristiche senza sapere già il risultato.
Apprendimento non supervisionato
L’altra modalità di apprendimento è quella non-supervisionata, quella in cui non si conosce a priori la variabile target.
Come abbiamo detto prima, questa tecnica è particolarmente utile quando bisogna fare raggruppamenti. I clienti di un’azienda possono essere visti come punti in uno spazio, e le loro caratteristiche come coordinate che li dispongono nello spazio.
In questo modo sarà possibile raggruppare insieme dei clienti che hanno caratteristiche simili e offrire delle soluzioni mirate in base a quelle caratteristiche. Una volta trovati i cluster, si può procedere alla loro definizione, assegnare un nome e delle descrizioni.

NB. Esistono delle eccezioni a queste due macro-categorie di modalità di apprendimento: apprendimento con rinforzo e l’apprendimento semi-supervisionato. Se vuoi approfondire, ti suggerisco questi link: https://it.wikipedia.org/wiki/Apprendimento_per_rinforzo, https://ichi.pro/it/apprendimento-semi-supervisionato-e-non-supervisionato-123112420957387.
Per capire e utilizzare al meglio il Machine Learning bisogna sempre tenere a mente queste due costellazioni: è quindi fondamentale la comprensione del problema.
In base al problema che ci troviamo davanti dobbiamo optare per il giusto scopo e la giusta modalità. Collocare male il problema non comporta solo una parziale perdita di informazione o di precisione, ma rischia di inficiare totalmente il nostro lavoro.
Davanti ad un nuovo progetto la prima cosa che dobbiamo chiederci è: di che tipo è la variabile target? E’ nota a priori o devo dedurla?
Queste sono domande fondamentali per capire come avviene l’apprendimento nel Machine Learning.
Autore: Davide Nardini
