Categories: MLphpStatistica

La Statistica è un DETECTIVE. Vuole scoprire chi è il colpevole mentre Il Machine Learning è un VEGGENTE. Vuole indovinare cosa succederà dopo.

Esempio 1: Il caldo e il gelato (il più semplice)

  • La Statistica (il Detective) dice: "Voglio esserne sicuro al 100%. Prendo i dati degli ultimi 10 anni. Scopro che ogni volta che la temperatura sale di 1 grado, le vendite di gelato salgono esattamente di 100 coni. Quindi posso dire con certezza: il caldo causa l'aumento del gelato." (La statistica ti dà il perché e la regola matematica precisa).

  • Il Machine Learning (il Veggente) dice: "Non mi interessa il perché. Io guardo la temperatura di oggi (32 gradi) e guardo gli ultimi 10 anni. Il mio cervello elettronico nota che quando faceva 32 gradi, si vendevano sempre circa 950 coni. Quindi oggi, senza sapere la formula, vi dico: venderemo 950 coni." (Il ML ti dà la previsione senza darti la regola).

Esempio 2: Il freddo, le gomme invernali e le 4 stagioni (il tuo esempio perfetto)

Qui la statistica classica va in crisi, perché la gente è imprevedibile (alcuni montano le invernali, altri le 4 stagioni).

  • La Statistica (il Detective) dice: "Aiuto! Questi dati sono sporchi e confusi. Per essere preciso, ho bisogno di sapere esattamente quante gomme invernali e quante 4 stagioni ci sono in magazzino, e chiedere a ogni cliente perché ha scelto quelle. Se non ho tutte queste risposte precise, non posso darti una formula matematica pulita. Mi fermo qui." (La statistica odia l'incertezza e senza regole chiare si blocca).

  • Il Machine Learning (il Veggente) dice: "Non mi interessa se è invernale o 4 stagioni! Dammi 500.000 ricevute di acquisti degli anni passati, con la temperatura di quei giorni. Anche se i dati sono confusi, io cerco le somiglianze. Scopro che quando il termometro scende sotto lo zero, il 70% della gente compra le invernali e il 30% le 4 stagioni. Non so perché, ma lo so. Se domani fa -5°, scommetto che la maggioranza comprerà le invernali." (Il ML non si blocca col caos, impara dai pattern nascosti).

Esempio 3: I giorni che passano e gli Smartphone (il più figo)

  • La Statistica (il Detective) dice: "Voglio capire l'effetto del tempo. Prendo il primo iPhone e l'ultimo. Faccio un conto e scopro che la tecnologia evolve in modo lineare: ogni anno la memoria aumenta di 10 GB. Questa è la regola: Tempo = Memoria." (La statistica cerca una linea dritta e semplice).

  • Il Machine Learning (il Veggente) dice: "Ma il mercato non è una linea dritta! Ci sono crisi economiche, mode, uscite di nuovi modelli... Io prendo milioni di dati (giorni, prezzi, uscite dei concorrenti, recensioni). Creo una ragnatela matematematica così complicata che nemmeno io so come funziona dentro. Ma alla domanda 'Tra 6 mesi quanti ne compreranno?', io ti rispondo con un numero. Forse sbaglierò del 2%, ma è la previsione più vicina alla realtà che esista." (Il ML accetta la complessità del mondo reale, la statistica no).

IL RIASSUNTO DEFINITIVO (con i tuoi esempi)

STATISTICA (Il Detective) MACHINE LEARNING (Il Veggente)
La domanda che si fa "Perché la gente compra più gelato quando fa caldo?" "Domani che fa caldo, quanti gelati vendo?"
Cosa serve per funzionare Pochi dati, ma perfetti e puliti (es. il termometro deve essere preciso). Tantissimi dati, anche sporchi e pieni di eccezioni (es. anche se qualcuno ha le 4 stagioni).
Il risultato che ti dà Una formula (es. Vendite = Temperatura x 100). Una previsione (es. Vendite = 950 coni), ma senza darti la formula.
Se sbaglia Dice: "Ho sbagliato perché i dati non erano precisi, rifacciamo il calcolo." Dice: "Ho sbagliato? Ok, correggo i miei collegamenti interni e riprovo finché non indovino meglio."

Come fa la STATISTICA (il Detective)?

Il detective non inventa niente. Lui ha già in testa una regola sospetta (ipotesi) e usa i dati solo per confermarla o distruggerla.

Fase 1: Si inventa una formula perfetta
Il detective dice: "Secondo me, il mondo funziona con una lineetta dritta: più caldo fa, più gelato si vende. La formula deve essere tipo: 

Gelati = (Caldo x 3) + 5

."

Fase 2: Prende pochi dati, ma buoni
Prende solo 10 giornate, ma segna con precisione estrema i gradi e i gelati venduti. Niente errori, niente "più o meno".

Fase 3: Fa i conti per vedere se la formula indovina
Il detective prende i dati veri e li infila nella sua formula inventata. Se la formula sbaglia di poco (es. prevede 100 gelati, ma ne sono stati venduti 102), il detective dice: "Va bene, correggo il numero 3 e lo trasformo in 3,1. Così la prossima volta indovino meglio."

Fase 4: Controlla l'Errore (la "paura di sbagliare")
La statistica ha un chiodo fisso: essere sicura al 95%.
Quindi, alla fine, il detective non si limita a dire "la formula è 

Gelati = (Caldo x 3,1) + 5

". Lui aggiunge sempre: "...E ho il 95% di certezza che questa formula sia vera. C'è solo un 5% di probabilità che io abbia sbagliato per puro caso."

Il "come" della Statistica: Prende un'idea, la trasforma in una formula matematica semplice (es. una riga dritta) e la aggiusta finché non si adatta ai dati. Alla fine ti dà la formula e il suo "tasso di fiducia".

Come fa il MACHINE LEARNING (il Veggente)?

Il veggente non ha idee in testa. Lui è completamente vuoto. Non sa nemmeno che caldo e gelato siano collegati. Il suo metodo è molto più bestiale:

Fase 1: Non inventa nessuna formula
Il veggente dice: "Io non so che formula usare. Non so se è una linea dritta, una curva, o un groviglio. Parto da zero."
Prende migliaia e migliaia di dati (non 10, ma 100.000 giornate) e ne divide una parte a caso.

Fase 2: Spara a caso (il tentativo iniziale)
Il veggente prende un giorno a caso (es. 30 gradi) e dice a caso: "Secondo me si vendono 1 gelato."
Naturalmente sbaglia in modo imbarazzante (ne sono stati venduti 900).

Fase 3: L'allenamento a suon di "sberle" (Backpropagation)
Qui arriva il suo superpotere: invece di correggere la formula (che non ha), lui si corregge da solo internamente.
Il veggente ha dentro di sé milioni di piccoli interruttori (come i neuroni). Quando sbaglia (ha detto 1, ma erano 900), lui sposta tutti questi interruttori in modo casuale e riprova con un'altra giornata. Sbaglia di meno? Allora tiene quella posizione. Sbaglia di più? Ne prova un'altra.
Lo fa milioni di volte (per giorni interi), finché i suoi interruttori interni si sistemano da soli in una posizione che gli permette di indovinare quasi sempre.

Fase 4: Il "buco nero" (la scatola nera)
Alla fine, il veggente indovina benissimo. Ma se gli chiedi: "Che formula hai usato?", lui risponde: "Non lo so. Dentro di me c'è un groviglio di 1.000.000 di interruttori impastati tra loro. Non esiste una formula semplice che io possa scriverti su un foglio. Ma ti giuro che funziona."

Il "come" del Machine Learning: Parte dal caos totale (risposte a caso), sbaglia milioni di volte, e a ogni sbaglio riaggiusta i suoi "ingranaggi interni" finché, senza mai usare una formula umana, impara a prevedere il futuro.

LA DIFESA DALL'ERRORE (la differenza fondamentale)

Vediamo il caso delle gomme invernali / 4 stagioni, che è incerto:

  • La Statistica (Detective) di fronte a un dato strano (uno che ha comprato le 4 stagioni nonostante il freddo) dice: "Questo dato è un 'errore statistico' (outlier). Lo segno, ma per la mia formula lo ignoro, perché voglio la regola generale." Cerca di rendere il mondo più semplice di quello che è.

  • Il Machine Learning (Veggente) di fronte a quello stesso dato strano dice: "Ah, interessante! Quindi ogni tanto la gente fa così. Invece di ignorarlo, lo tengo in memoria. Così se domani arriva un cliente strano, il mio sistema saprà che c'è un margine di imprevedibilità." Cerca di rendere il mondo più reale possibile, confusione inclusa.

La frasetta per ricordare il "come fanno":

La Statistica prende i dati e li infila in una formula che lei già conosce, aggiustandola un po'.
Il Machine Learning prende i dati e costruisce da solo una ragnatela dentro di sé, senza sapere quale formula sta usando, ma imparando dagli errori.

pasquale.clarizio

Recent Posts

API: interrogare e gestire le query in un file JSON

il file JSON è stato caricato all'interno della stessa ROOT dove persiste il file: rubrica.php…

20 ore ago

API in php perchè scriverla? a cosa serve?

API in PHP: perché, a cosa servono e come si scrivono Partiamo davvero da zero,…

20 ore ago

Gmail: che cosa c'è da sapere

I Migliori Trucchi per la Produttività 1. Annullare un'email già inviata Hai notato un errore…

20 ore ago

API: data una stringa estrai consonanti, vocali e numero dei caratteri della stringa

[crayon-6aabe26585582411083153/] Deve restituire (in JSON): il testo in minuscolo le vocali trovate le consonanti trovate il numero di lettere totali Ragioniamo…

21 ore ago

API di tipo GET e ricezione della stringa

api23.php?somma=8+9 Ti spiego cosa succede davvero quando scrivi un URL così, perché qui c'è un equivoco importante…

21 ore ago

API: creazione e gestione in Php

[crayon-6aabe26585b94414756567/] Questo script PHP crea e restituisce una risposta in formato JSON, comunemente utilizzata come…

21 ore ago