Il report attribuito ha sbagliato di tre volte

Il caso eBay mostra che i report attribuiti possono sovrastimare l'incrementalità, mentre gli holdout geografici randomizzati rivelano un incremento quasi nullo.

Il report attribuito ha sbagliato di tre volte

Uno studio su 15 esperimenti Facebook ha mostrato che i metodi osservazionali possono sbagliare anche di molto

Il report attribuito dice decine di milioni. Poi accendi un holdout geografico randomizzato e l’incremento reale è quasi zero. L’episodio eBay documentato nelle scorse settimane ha mostrato esattamente questo: un reporting attribuito che valutava decine di milioni di dollari un’incrementalità che holdout geografici realmente randomizzati — gruppi di controllo geografici a cui gli annunci non vengono mostrati — hanno rivelato essere quasi nulla. Per chi gestisce campagne a pagamento, è la fotografia esatta del divario tra reporting e causalità.

Ma si tratta di un’anomalia di eBay o di un problema strutturale della misurazione osservazionale? La risposta, per la ricerca degli ultimi anni, è scomoda.

Il caso eBay: il report promette, l’holdout smentisce

L’episodio eBay è il caso che ogni paid media manager riconosce: la dashboard della piattaforma attribuisce decine di milioni di valore incrementale, poi un holdout geografico randomizzato mostra che l’incremento reale è quasi zero. Non è una differenza marginale: è il passaggio da «stiamo generando valore» a «stiamo allocando su una stima».

La domanda che resta aperta è se eBay sia un caso isolato o se il problema riguardi l’intera classe dei metodi osservazionali. Per rispondere, la ricerca accademica ha fatto qualcosa di raro: ha replicato gli studi su larga scala.

Il paradosso dei metodi osservazionali

Già nel 2019, Marketing Science ha pubblicato uno degli studi empirici più rilevanti dell’ultimo decennio sulla misurazione pubblicitaria digitale. Brett Gordon, Florian Zettelmeyer, Neha Bhargava e Dan Chapsky, lavorando con l’infrastruttura di sperimentazione pubblicitaria di Facebook, hanno analizzato 15 esperimenti pubblicitari su larga scala negli Stati Uniti, con 500 milioni di osservazioni utente-esperimento e 1,6 miliardi di impression pubblicitarie. La domanda era quella che il settore aveva evitato per quindici anni: i metodi osservazionali sono in grado di replicare i risultati degli esperimenti randomizzati (RCT, randomized controlled trial)?

La risposta è stata un no ampio. Secondo Gordon, Zettelmeyer, Bhargava e Chapsky, rispetto al benchmark sperimentale i metodi osservazionali hanno mancato ampiamente il bersaglio: hanno spesso sovrastimato le conversioni incrementali di un fattore 3 o più, a volte le hanno sottostimate, e senza alcun modo affidabile di sapere in anticipo in quale direzione o di quanto sarebbe stato l’errore.

E non è un caso isolato nel tempo. Nel 2023, Gordon, Robert Moakler e Zettelmeyer hanno replicato l’esercizio su centinaia di esperimenti, di nuovo su Marketing Science: stessa conclusione, scala più ampia. Su 12 studi analizzati, i metodi osservazionali non si sono rivelati un sostituto affidabile degli RCT: il metodo osservazionale più sofisticato ha performato bene in alcuni studi, ma era impossibile prevedere quando sarebbe accaduto. Per avere un parametro concreto, i lift mediani degli RCT sono il 29%, il 18% e il 5% rispettivamente per gli esiti del funnel superiore, medio e inferiore.

Cosa pretendere dalle piattaforme: esperimenti, non stime

La risposta non è rinunciare ai dati, ma cambiare tipo di dato: pretendere il gruppo di controllo randomizzato. Le piattaforme sono in grado di produrre due classi completamente diverse di misurazione: da un lato gli studi di lift randomizzati, che sono evidenza causale; dall’altro le misurazioni modellate e attribuite, che non lo sono. Solo una di queste due classi è una prova.

È qui che entrano in gioco i lift randomizzati e l’approccio ghost ads. I ghost ads, pubblicati nel Journal of Marketing Research nel 2017, identificano gli utenti del gruppo di controllo che avrebbero ricevuto l’annuncio, rendendo gli esperimenti di piattaforma economici e puliti. E poi c’è Conversion Lift, lo strumento di incrementalità che misura il numero di acquisti, visite al sito e qualsiasi altra conversione generata direttamente dalle persone che vedono i tuoi annunci.

Il cerchio si chiude: la scelta per chi pianifica budget è tra stima e prova. La prossima volta che una dashboard vi mostra un incremento, chiedete: dov’è il gruppo di controllo randomizzato? Se non c’è, state allocando budget su una stima, non su una prova.