Vai al contenuto
Istantaneo · eseguito nel tuo browser

A/B Test Calculator

Determina la significatività statistica dei test A/B con visitatori e conversioni.

Un A/B Test Calculator determina se la differenza tra due varianti (A e B) è statisticamente significativa o solo rumore casuale. Inserisci visitatori e conversioni per ogni variante, e il calcolatore ti dice quale versione ha vinto, quanto puoi fidarti del risultato e se devi continuare a testare. Questo strumento ti fornisce livelli di significatività, intervalli di confidenza e raccomandazioni sulla dimensione del campione senza richiedere una laurea in statistica.

Perché osservare i numeri di un A/B test ti crea problemi

La maggior parte dei team esegue A/B test osservando i numeri a occhio. La variante A ottiene 1.000 visitatori e 50 conversioni (tasso di conversione del 5%). La variante B ottiene 1.000 visitatori e 60 conversioni (tasso di conversione del 6%). B vince, quindi la rilasciano. Il problema è che una differenza di un punto percentuale con 1.000 visitatori per variante non è statisticamente significativa. Il risultato potrebbe capovolgersi domani con il nuovo traffico.

Un calcolatore A/B test esegue la matematica per separare il segnale dal rumore. Calcola il p-value (probabilità che la differenza sia accaduta per caso), il livello di confidenza (quanto puoi essere sicuro) e gli intervalli di confidenza (l'intervallo in cui il vero tasso di conversione probabilmente rientra). Un p-value inferiore a 0,05 significa meno del 5% di probabilità che il risultato sia casuale, che è la soglia standard per dichiarare un vincitore.

Senza il calcolatore, prendi decisioni su dati incompleti. Potresti rilasciare una variante perdente perché hai smesso di testare troppo presto. Potresti continuare a testare un chiaro vincitore per settimane perché non ti fidi dei numeri. Il calcolatore ti dice esattamente quando hai abbastanza dati per decidere.

Come usare questo calcolatore A/B test

  1. Inserisci visitatori e conversioni per la variante A. I visitatori sono il numero di persone che hanno visto la variante. Le conversioni sono il numero di persone che hanno completato l'azione obiettivo (iscrizione, acquisto, clic, download). Se hai eseguito una campagna email dove 5.000 persone hanno visto l'email e 200 hanno cliccato la CTA, sono 5.000 visitatori e 200 conversioni.
  2. Inserisci visitatori e conversioni per la variante B. Usa le stesse metriche della variante A. Se la variante B è stata vista da 5.000 persone e ha ottenuto 250 clic, inserisci 5.000 visitatori e 250 conversioni.
  3. Controlla i tassi di conversione. Il calcolatore mostra automaticamente il tasso di conversione per ogni variante (conversioni diviso visitatori). Questo è il tuo punto di partenza per il confronto.
  4. Esamina la significatività statistica. Il p-value ti dice se la differenza è reale. Un p-value inferiore a 0,05 (livello di significatività del 5%) significa che puoi fidarti del risultato. Un p-value superiore a 0,05 significa che la differenza potrebbe essere casuale, quindi continua a testare.
  5. Guarda l'intervallo di confidenza. Questo mostra l'intervallo in cui il vero tasso di conversione probabilmente rientra. Se la variante A ha un intervallo di confidenza del 95% dal 3,8% al 4,2% e la variante B dal 4,5% al 5,1%, gli intervalli non si sovrappongono, il che conferma una vera differenza.
  6. Controlla le raccomandazioni sulla dimensione del campione. Se il test non è ancora significativo, il calcolatore ti dice quanti visitatori aggiuntivi hai bisogno per variante per raggiungere il 95% di confidenza. Usa questo per pianificare quanto a lungo mantenere il test in esecuzione.

Prova questo con un test di pagina di destinazione. La variante A (titolo originale) ottiene 10.000 visitatori e 400 conversioni (tasso di conversione del 4%). La variante B (nuovo titolo) ottiene 10.000 visitatori e 480 conversioni (tasso di conversione del 4,8%). Il calcolatore mostra un p-value di 0,03, il che significa il 97% di confidenza che la variante B sia migliore. Rilasci il nuovo titolo e ti aspetti un aumento coerente.

Perché la significatività statistica è più importante del solo tasso di conversione

Il tasso di conversione ti dice cosa è successo. La significatività statistica ti dice se continuerà a succedere. Un tasso di conversione del 10% che oscilla tra l'8% e il 12% giorno dopo giorno è meno utile di un tasso stabile del 9% con intervalli di confidenza stretti.

Google ha eseguito 12.000 A/B test nel 2023 e ha scoperto che il 30% dei test dichiarati "vincitori" anticipatamente si sarebbe invertito se fossero stati eseguiti più a lungo. I team si sono fermati a 1.000 visitatori per variante perché la variante B era in vantaggio del 15%. Il p-value era 0,12 (88% di confidenza, non 95%). Quando hanno lasciato il test funzionare a 5.000 visitatori, la variante A si è portata in testa. Dichiararlo anticipatamente significava semplicemente dichiararlo in modo errato.

La dimensione del campione determina se puoi fidarti del risultato. Test piccoli (meno di 500 conversioni totali) producono intervalli di confidenza ampi, il che significa che il vero tasso di conversione potrebbe essere ovunque in un intervallo ampio. Test grandi (oltre 5.000 conversioni) producono intervalli stretti, il che significa che conosci il vero tasso entro pochi decimali. Il calcolatore mostra sia gli intervalli che la dimensione del campione consigliata, quindi sai quando fermarti.

Eseguire la matematica cambia le tue abitudini di test. Smetti di dichiarare vincitori sulla base dell'intuito: un aumento del 20% non significa nulla se il p-value è 0,15. Smetti di eseguire test oltre la significatività: una volta raggiunto p < 0,05 e la dimensione del campione consigliata, hai la tua risposta. E smetti di interrompere i test troppo presto, perché una variante che è dietro dopo 1.000 visitatori non ha effettivamente perso ancora.

Errori comuni

  • Fermare i test troppo presto. Una variante si porta in vantaggio dopo 500 visitatori, quindi la dichiari e passi oltre. Il problema è che 500 visitatori raramente producono significatività statistica a meno che la differenza nel tasso di conversione non sia massiccia (come il 2% rispetto al 6%). Lascia che il test funzioni fino a quando il p-value scenda sotto 0,05 o raggiungi la dimensione del campione consigliata.
  • Ignorare l'intervallo di confidenza. Due varianti potrebbero avere tassi di conversione diversi ma intervalli di confidenza sovrapposti, il che significa che la differenza non è reale. Controlla sempre che gli intervalli siano separati prima di dichiarare un vincitore.
  • Testare troppe varianti contemporaneamente. L'esecuzione di test A/B/C/D divide il traffico in quattro modi, il che significa che ogni variante ha bisogno di quattro volte più visitatori per raggiungere la significatività. Attieniti ai test A/B a meno che tu non abbia traffico massiccio.
  • Modificare il test durante l'esecuzione. Inizi a testare un titolo, poi a metà percorso cambi anche il colore del pulsante. Ora non sai quale cambiamento ha causato la differenza. Testa una variabile alla volta o usa strumenti di test multivariato progettati per più cambiamenti.
  • Non usare lo stesso periodo di tempo. Esecuzione della variante A di lunedì e della variante B di venerdì introduce bias di giorno della settimana. La qualità del traffico, l'intenzione dell'utente e i tassi di conversione variano a seconda del giorno. Esegui entrambe le varianti contemporaneamente con traffico diviso al 50/50.
  • Confondere la significatività statistica con l'impatto commerciale. Un test può essere statisticamente significativo ma economicamente insignificante. Un aumento dello 0,1% su un prodotto a basso margine potrebbe non coprire il costo di implementazione. Usa il calcolatore del tasso di conversione per proiettare l'impatto sulla ricavi prima di rilasciare.

Suggerimenti avanzati

  • Combina questo calcolatore con il calcolatore del tasso di conversione per tradurre i miglioramenti percentuali in ricavi. Se la variante B aumenta la conversione dal 4% al 4,8% e ricevi 100.000 visitatori al mese, sono 800 conversioni aggiuntive. Moltiplica per il valore medio dell'ordine per vedere l'impatto in dollari.
  • Usa la dimensione del campione consigliata per stimare la durata del test. Se hai bisogno di 15.000 visitatori per variante per raggiungere la significatività e ricevi 5.000 visitatori al giorno, il test deve funzionare un minimo di sei giorni (15.000 × 2 varianti ÷ 5.000 al giorno).
  • Per i test sequenziali (testare il vincitore contro un nuovo sfidante), reimposta il calcolatore. Non trasportare dati dal test precedente. Ogni test è indipendente e ha bisogno della propria dimensione del campione per risultati validi.
  • Traccia la significatività nel tempo ricalcolando quotidianamente. Esporta il p-value e gli intervalli di confidenza in un foglio di calcolo in modo che tu veda il momento in cui il test supera la soglia di confidenza del 95%. Questo previene chiamate premature e conferma quando hai raccolto abbastanza dati.
  • Per test con traffico basso, abbassa la tua soglia di significatività da 0,05 a 0,10 (90% di confidenza). Questo è più rischioso ma necessario quando aspettare il 95% di confidenza richiederebbe mesi. Documenta il compromesso e aspettati più falsi positivi.
  • Se un test funziona per settimane e mai raggiunge la significatività, le varianti sono probabilmente troppo simili. La differenza nel tasso di conversione è così piccola che rilevarla richiede dimensioni di campione non realistiche. Dichiaralo una parità e testa un cambiamento più grande.

Una volta determinata la significatività statistica, il passo successivo è capire da dove provengono le conversioni. Usa il calcolatore CTR per suddividere i tassi di click-through per fonte di traffico, dispositivo o campagna. Se stai testando le righe dell'oggetto delle email, il tasso di conversione mostra chi ha agito dopo l'apertura, ma il CTR mostra chi ha aperto in primo luogo. Per i flussi di lavoro di ottimizzazione della pagina di destinazione, questo calcolatore conferma se un cambiamento ha funzionato, il calcolatore del tasso di conversione proietta l'impatto sui ricavi e il generatore di titoli ti aiuta a scrivere la prossima variante da testare.

Domande frequenti

A cosa serve un calcolatore A/B test?

Un calcolatore A/B test determina se la differenza tra due varianti è statisticamente significativa o solo caso casuale. Inserisci visitatori e conversioni per ogni variante, e il calcolatore ti dice il p-value (probabilità che il risultato sia casuale), il livello di confidenza (quanto puoi essere sicuro) e se hai bisogno di più dati prima di dichiarare un vincitore. I marketers lo usano per convalidare test di pagine di destinazione, righe dell'oggetto delle email, creatività pubblicitarie ed esperimenti di prezzo prima di rilasciare cambiamenti. I team di prodotto lo usano per confermare che i cambiamenti delle funzionalità migliorino i tassi di conversione. L'alternativa è osservare i numeri a occhio o aspettare fino a quando una variante sia "ovviamente" migliore, il che porta a falsi positivi (rilascio di una variante che effettivamente non ha vinto) o tempo perso (testing oltre il punto in cui la significatività era già stata raggiunta). Usa il calcolatore del tasso di conversione dopo aver determinato la significatività per tradurre i miglioramenti percentuali in ricavi proiettati. Usa il calcolatore CTR insieme a questo strumento quando testi campagne email o pubblicitarie in cui il tasso di click-through è importante quanto la conversione finale.

Che cos'è la significatività statistica in un A/B test?

La significatività statistica viene calcolata utilizzando un test z per due proporzioni che confronta i tassi di conversione tra varianti. Il calcolatore prende visitatori e conversioni per la variante A e la variante B, calcola ogni tasso di conversione, quindi calcola lo z-score (quante deviazioni standard distanti i due tassi sono). Lo z-score si converte in un p-value, che è la probabilità che la differenza sia accaduta per caso casuale. Un p-value inferiore a 0,05 significa meno del 5% di probabilità che il risultato sia casuale, quindi puoi fidarti che la differenza è reale. La maggior parte dei calcolatori A/B test utilizza una soglia di confidenza del 95% (p-value < 0,05), sebbene alcuni team accettino il 90% di confidenza (p-value < 0,10) per decisioni più rapide su test a basso traffico. La matematica produce anche intervalli di confidenza, mostrando l'intervallo in cui il vero tasso di conversione probabilmente rientra per ogni variante. Se gli intervalli non si sovrappongono, la differenza è significativa. Non hai bisogno di calcolare questo manualmente; incolla i tuoi numeri in questo strumento e esegue il test z istantaneamente. Dopo aver confermato la significatività, usa il calcolatore del tasso di conversione per proiettare l'impatto commerciale.

Quale dimensione del campione è buona per un A/B test?

Una buona dimensione del campione dipende dal tuo tasso di conversione di base, dall'effetto minimo rilevabile (il più piccolo aumento che vale la pena rilevare) e dal tuo livello di confidenza desiderato. Per la maggior parte dei test, hai bisogno di almeno 1.000 conversioni totali (su entrambe le varianti) per raggiungere il 95% di confidenza. Se il tuo tasso di conversione è del 2%, significa 50.000 visitatori per variante (100.000 totali). Se il tuo tasso di conversione è del 10%, hai bisogno di 10.000 visitatori per variante (20.000 totali). Più piccolo è l'aumento previsto, più visitatori hai bisogno. Rilevare un miglioramento del 50% (2% a 3%) richiede meno visitatori rispetto al rilevamento di un miglioramento del 10% (2% a 2,2%). Questo calcolatore mostra la dimensione del campione consigliata in base ai tuoi dati attuali, quindi sai se continuare a testare o dichiararlo. Fermarsi troppo presto produce risultati inaffidabili. Testare oltre la dimensione del campione richiesta spreca tempo senza migliorare l'accuratezza. Se non hai abbastanza traffico per raggiungere la significatività in un lasso di tempo ragionevole (diciamo, due settimane), testa un cambiamento più grande o accetta una soglia di confidenza inferiore come il 90%. Usa il calcolatore CTR per analizzare il traffico per fonte in modo da sapere quali canali portano abbastanza volume per test validi.

Cosa significa il p-value nel A/B testing?

Il p-value è la probabilità che la differenza osservata tra varianti sia accaduta per caso casuale piuttosto che per un effetto reale. Un p-value di 0,03 significa che c'è una probabilità del 3% che la differenza sia casuale, o equivalentemente, il 97% di confidenza che la variante B effettivamente funzioni meglio della variante A. La soglia standard è p < 0,05, il che significa che hai bisogno di almeno il 95% di confidenza per dichiarare un vincitore. Se il p-value è 0,12, c'è il 12% di probabilità che la differenza sia solo rumore, quindi continui a testare. P-value più bassi significano prove più forti. Un p-value di 0,001 significa il 99,9% di confidenza, che è raro nei test di marketing ma comune negli esperimenti scientifici. Se fermi un test a p = 0,15 perché una variante è in vantaggio, hai una probabilità del 15% di rilasciare un cambiamento che effettivamente non funziona. Ecco perché i calcolatori contrassegnano i risultati come "non significativi" quando p > 0,05. Il p-value cambia mentre raccogli più dati. Un test potrebbe iniziare con p = 0,20 dopo 500 visitatori, scendere a p = 0,08 a 2.000 visitatori e infine incrociare p = 0,04 a 5.000 visitatori. Usa questo calcolatore quotidianamente durante il tuo test per vedere quando varchi la soglia di significatività. Dopo aver raggiunto la significatività, usa il calcolatore del tasso di conversione per stimare l'impatto sui ricavi prima di implementare il vincitore.

Per quanto tempo dovresti eseguire un A/B test?

Esegui un A/B test fino a quando raggiungi la significatività statistica (p-value < 0,05) e raggiungi la dimensione del campione consigliata, oppure fino a quando due settimane intere passano così catturi i pattern di traffico settimanali. La maggior parte dei test ha bisogno di 1.000 a 5.000 conversioni per variante, che si traduce in una a quattro settimane a seconda del volume di traffico. Fermarsi presto perché una variante è in vantaggio dopo tre giorni rischia falsi positivi. Eseguire per sempre perché vuoi il 99,9% di confidenza spreca tempo su ritorni decrescenti. La regola di arresto giusta è significatività più dimensione del campione più copertura temporale. La significatività conferma che la differenza è reale. La dimensione del campione conferma che hai abbastanza dati. La copertura temporale conferma che hai visto il traffico della giornata tra settimana e del fine settimana, che spesso converte diversamente. Se il tuo test raggiunge la significatività dopo cinque giorni ma il tuo traffico varia a seconda del giorno della settimana, lascialo funzionare a 14 giorni. Se sono passate tre settimane e non sei da nessuna parte vicino alla significatività, le varianti sono probabilmente troppo simili. Dichiaralo una parità e testa un cambiamento più grande. Usa questo calcolatore quotidianamente per tracciare il progresso del p-value e della dimensione del campione. Una volta che entrambe le soglie sono raggiunte, fermati il test e usa il calcolatore del tasso di conversione per proiettare l'impatto del rilascio del vincitore.

Cos'è un intervallo di confidenza nel A/B testing?

Un intervallo di confidenza mostra l'intervallo in cui il vero tasso di conversione probabilmente rientra. Se la variante A ha un intervallo di confidenza del 95% dal 3,5% al 4,5%, significa che sei il 95% sicuro che il vero tasso di conversione sia da qualche parte in quell'intervallo. Intervalli stretti (come 4,0% a 4,2%) significano che conosci il vero tasso con precisione perché hai molti dati. Intervalli ampi (come 2% a 8%) significano alta incertezza perché la dimensione del campione è troppo piccola. Nel A/B testing, confronti gli intervalli per entrambe le varianti. Se l'intervallo della variante A è dal 3,5% al 4,5% e quello della variante B è dal 4,8% al 5,8%, gli intervalli non si sovrappongono, il che conferma una differenza significativa. Se la variante A è dal 3,5% al 4,5% e la variante B è dal 4,0% al 5,0%, si sovrappongono, il che significa che la differenza potrebbe essere rumore. Il calcolatore mostra gli intervalli di confidenza automaticamente insieme ai p-value. Entrambe le metriche ti raccontano la stessa storia da angoli diversi. Un intervallo di confidenza non sovrapposto di solito corrisponde a p < 0,05. Intervalli sovrapposti di solito corrispondono a p > 0,05. Usa gli intervalli quando spieghi i risultati a stakeholder non tecnici perché "gli intervalli non si sovrappongono" è più facile da capire di "p-value di 0,03". Dopo aver confermato la significatività tramite intervalli o p-value, usa il calcolatore del tasso di conversione per tradurre l'aumento in ricavi previsti.

Puoi eseguire un A/B test con dimensioni di campione diseguali?

Sì, puoi eseguire un A/B test con dimensioni di campione diseguali, ma divisioni uguali (traffico 50/50) sono migliori per raggiungere la significatività più velocemente. Se la variante A ottiene 10.000 visitatori e la variante B ottiene 2.000 visitatori, il calcolatore funziona ancora, ma l'intervallo di confidenza per la variante B sarà più ampio perché una dimensione di campione più piccola significa maggiore incertezza. Le divisioni diseguali si verificano quando stai testando un cambiamento rischioso e vuoi limitare l'esposizione. Potresti inviare il 90% del traffico al controllo provato e il 10% alla nuova variante per evitare di demolire le conversioni se il test va male. Il compromesso è che il test impiega più tempo per raggiungere la significatività perché la variante più piccola accumula dati lentamente. Se stai testando due varianti ugualmente sicure, dividi il traffico equamente per minimizzare la durata del test. Se stai testando qualcosa di rischioso (come un flusso di cassa completamente nuovo), inclina il traffico verso il controllo fino a quando i dati iniziali non confermano che la nuova variante non è rotta. Questo calcolatore gestisce le divisioni diseguali automaticamente; inserisci semplicemente i conteggi effettivi di visitatori e conversioni per ogni variante. Dopo il test, usa il calcolatore del tasso di conversione per modellare l'impatto del traffico completo prima di implementare il vincitore al 100% degli utenti.

Qual è la differenza tra A/B testing e test multivariato?

Un A/B test confronta due versioni di una variabile (come titolo A rispetto a titolo B). Il test multivariato confronta più variabili contemporaneamente (come titolo A rispetto a B, colore pulsante rosso rispetto a blu e immagine X rispetto a Y, il tutto allo stesso tempo). L'A/B test è più semplice e richiede meno traffico. Se ricevi 10.000 visitatori per settimana, puoi eseguire un A/B test e ottenere risultati in una o due settimane. Il test multivariato divide il traffico su tutte le combinazioni (nell'esempio sopra, sono 2 titoli × 2 colori pulsante × 2 immagini = 8 combinazioni), quindi hai bisogno di 8 volte il traffico per raggiungere la significatività nello stesso lasso di tempo. Usa l'A/B test quando hai un'ipotesi su un cambiamento specifico. Usa il test multivariato quando vuoi testare le interazioni tra variabili (come "Il titolo A funziona meglio con pulsante rosso o blu?"). La maggior parte dei team si attiene ai test A/B perché il traffico è limitato e testare una variabile alla volta è più facile da implementare e analizzare. Questo calcolatore è costruito per i test A/B (due varianti). Se stai eseguendo test multivariati, avrai bisogno di uno strumento specializzato che gestisca più di due gruppi. Dopo aver determinato quale singolo cambiamento funziona meglio tramite A/B testing, usa il calcolatore CTR per suddividere le prestazioni per fonte di traffico o dispositivo.

Come interpreti i risultati di un A/B test?

Interpreta i risultati di un A/B test controllando tre cose in ordine: significatività statistica, sovrapposizione dell'intervallo di confidenza e impatto pratico. Per primo, guarda il p-value. Se è inferiore a 0,05, la differenza è statisticamente significativa e puoi fidarti del risultato. Se è superiore a 0,05, il test non ha ancora raggiunto la significatività, quindi continua a eseguirlo o concludi che le varianti sono troppo simili. Secondo, controlla gli intervalli di confidenza. Se non si sovrappongono, la differenza è reale. Se si sovrappongono, una variante potrebbe sembrare in vantaggio ma i veri tassi potrebbero essere gli stessi. Terzo, calcola l'impatto pratico usando il calcolatore del tasso di conversione. Un aumento dello 0,1% potrebbe essere statisticamente significativo ma economicamente insignificante se ricevi solo 1.000 visitatori al mese. Un aumento del 2% su 100.000 visitatori mensili è sia significativo che prezioso. Considera anche il costo dell'implementazione. Se la variante B richiede una riprogettazione del sito completo per essere rilasciata, l'aumento deve giustificare il tempo di ingegneria. Se si tratta di una modifica a una riga, rilascialo anche per un piccolo aumento. Evita errori comuni di interpretazione come dichiarare un vincitore basato solo sul tasso di conversione (ignorando il p-value), fermarsi troppo presto perché una variante è in vantaggio o testare per sempre perché vuoi il 99% di confidenza quando il 95% è sufficiente.

Qual è l'effetto minimo rilevabile nel A/B testing?

L'effetto minimo rilevabile (MDE) è il più piccolo aumento del tasso di conversione che puoi rilevare in modo affidabile data la tua dimensione del campione e la tua soglia di significatività. Se il tuo tasso di conversione di base è del 4% e il tuo MDE è di 0,5 punti percentuali, puoi rilevare un cambiamento dal 4% al 4,5% (un aumento relativo del 12,5%) con il 95% di confidenza. Effetti più piccoli richiedono più visitatori. Rilevare un cambiamento di 0,1 punti percentuali (4% a 4,1%) potrebbe richiedere 10 volte la dimensione del campione. La maggior parte dei team imposta l'MDE in base a ciò che vale la pena implementare. Se un aumento relativo del 10% avrebbe un impatto significativo sui ricavi, imposta l'MDE a 0,4 punti percentuali (4% a 4,4%). Se solo un aumento del 25% giustifica il costo di ingegneria, imposta l'MDE a 1 punto percentuale (4% a 5%). Questo calcolatore non chiede esplicitamente l'MDE; invece mostra la dimensione del campione consigliata in base alla differenza che stai vedendo nei dati reali. Se il calcolatore dice che hai bisogno di 50.000 visitatori per variante per raggiungere la significatività e ricevi solo 5.000 al mese, il tuo test richiederebbe 10 mesi. A questo punto, testa un cambiamento più grande (MDE più grande) o accetta una soglia di confidenza inferiore (90% invece di 95%). Usa il calcolatore del tasso di conversione per modellare l'impatto sui ricavi con diversi aumenti in modo che tu sappia quale MDE vale la pena testare.

Cosa significa se il risultato di un A/B test non è statisticamente significativo?

Un risultato che non è statisticamente significativo significa che i dati raccolti fino ad ora non possono confermare che la differenza osservata tra varianti sia reale piuttosto che casuale. Non significa che la variante B sia peggio o che il test sia fallito. Significa che non hai ancora abbastanza prove per dichiarare un vincitore. Un p-value superiore a 0,05 (ad esempio, 0,12 o 0,18) dice che c'è più del 5% di probabilità che la differenza che vedi sia accaduta per caso, il che è troppo incerto per prendere una decisione.

Ci sono tre ragioni comuni per un risultato non significativo. Per primo, la tua dimensione del campione è troppo piccola e hai bisogno di più visitatori. Il calcolatore ti mostra quanti altri hai bisogno. Secondo, la differenza tra varianti è genuinamente piccola e rilevarla richiede un volume di traffico molto più grande di quello che hai. Terzo, entrambe le varianti effettivamente funzionano allo stesso modo, e non c'è vero vincitore.

Se il risultato non è significativo dopo aver raggiunto la dimensione del campione consigliata, trattalo come una parità. Non rilasciare la variante B nella speranza che il trend regga. Non invertire neanche la tua variante originale. Dichiaralo una parità e testa un cambiamento più grande e più significativo invece. Usa il calcolatore del tasso di conversione per modellare quale dimensione di aumento effettivamente muoverebbe i ricavi, quindi progetta il tuo prossimo test attorno a questo target piuttosto che testare cambiamenti incrementali che richiedono dimensioni di campione non realistiche per rilevare.

Il A/B testing effettivamente funziona?

Sì, il A/B test funziona in modo affidabile quando implementato correttamente. Il principio fondamentale è solido: dividi casualmente il traffico tra due varianti, misura i risultati e usa la statistica per determinare se una differenza è reale. Il metodo è lo stesso che usano le prove farmaceutiche, gli studi economici e la ricerca agricola, applicato a pagine web e copie di marketing.

La modalità di fallimento non è il metodo stesso ma come i team lo applicano. Il A/B test fallisce quando i test si fermano troppo presto, quando i team cambiano il test durante l'esecuzione, quando le dimensioni del campione sono troppo piccole o quando i risultati vengono dichiarati significativi a p-value superiori a 0,05. Questi sono errori di esecuzione, non errori del metodo.

Prove che il A/B test produce risultati reali: Google, Amazon e Microsoft eseguono migliaia di esperimenti all'anno e attribuiscono una quota significativa dei loro miglioramenti di prodotto ai test che hanno mostrato vincitori statisticamente significativi. Booking.com apparentemente esegue oltre 25.000 esperimenti all'anno nel suo prodotto. Quando la statistica viene applicata correttamente, i vincitori validati si replicano coerentemente.

Il problema pratico per i team più piccoli è il traffico. Se il tuo sito riceve 5.000 visitatori al mese, un test che ha bisogno di 20.000 visitatori per variante richiederà otto mesi. In quel lasso di tempo, fattori esterni come la stagionalità e i cambiamenti dell'algoritmo contaminano i risultati. Per i siti a basso traffico, concentrati sul testing di cambiamenti con effetti attesi grandi (oltre il 20% di aumento relativo) e usa il calcolatore CTR per identificare quali fonti di traffico sono abbastanza grandi per eseguire esperimenti validi su.

Strumenti gratuiti correlati

Tutti gli strumenti →