Perché osservare i numeri di un A/B test ti crea problemi
La maggior parte dei team esegue A/B test osservando i numeri a occhio. La variante A ottiene 1.000 visitatori e 50 conversioni (tasso di conversione del 5%). La variante B ottiene 1.000 visitatori e 60 conversioni (tasso di conversione del 6%). B vince, quindi la rilasciano. Il problema è che una differenza di un punto percentuale con 1.000 visitatori per variante non è statisticamente significativa. Il risultato potrebbe capovolgersi domani con il nuovo traffico.
Un calcolatore A/B test esegue la matematica per separare il segnale dal rumore. Calcola il p-value (probabilità che la differenza sia accaduta per caso), il livello di confidenza (quanto puoi essere sicuro) e gli intervalli di confidenza (l'intervallo in cui il vero tasso di conversione probabilmente rientra). Un p-value inferiore a 0,05 significa meno del 5% di probabilità che il risultato sia casuale, che è la soglia standard per dichiarare un vincitore.
Senza il calcolatore, prendi decisioni su dati incompleti. Potresti rilasciare una variante perdente perché hai smesso di testare troppo presto. Potresti continuare a testare un chiaro vincitore per settimane perché non ti fidi dei numeri. Il calcolatore ti dice esattamente quando hai abbastanza dati per decidere.
Come usare questo calcolatore A/B test
- Inserisci visitatori e conversioni per la variante A. I visitatori sono il numero di persone che hanno visto la variante. Le conversioni sono il numero di persone che hanno completato l'azione obiettivo (iscrizione, acquisto, clic, download). Se hai eseguito una campagna email dove 5.000 persone hanno visto l'email e 200 hanno cliccato la CTA, sono 5.000 visitatori e 200 conversioni.
- Inserisci visitatori e conversioni per la variante B. Usa le stesse metriche della variante A. Se la variante B è stata vista da 5.000 persone e ha ottenuto 250 clic, inserisci 5.000 visitatori e 250 conversioni.
- Controlla i tassi di conversione. Il calcolatore mostra automaticamente il tasso di conversione per ogni variante (conversioni diviso visitatori). Questo è il tuo punto di partenza per il confronto.
- Esamina la significatività statistica. Il p-value ti dice se la differenza è reale. Un p-value inferiore a 0,05 (livello di significatività del 5%) significa che puoi fidarti del risultato. Un p-value superiore a 0,05 significa che la differenza potrebbe essere casuale, quindi continua a testare.
- Guarda l'intervallo di confidenza. Questo mostra l'intervallo in cui il vero tasso di conversione probabilmente rientra. Se la variante A ha un intervallo di confidenza del 95% dal 3,8% al 4,2% e la variante B dal 4,5% al 5,1%, gli intervalli non si sovrappongono, il che conferma una vera differenza.
- Controlla le raccomandazioni sulla dimensione del campione. Se il test non è ancora significativo, il calcolatore ti dice quanti visitatori aggiuntivi hai bisogno per variante per raggiungere il 95% di confidenza. Usa questo per pianificare quanto a lungo mantenere il test in esecuzione.
Prova questo con un test di pagina di destinazione. La variante A (titolo originale) ottiene 10.000 visitatori e 400 conversioni (tasso di conversione del 4%). La variante B (nuovo titolo) ottiene 10.000 visitatori e 480 conversioni (tasso di conversione del 4,8%). Il calcolatore mostra un p-value di 0,03, il che significa il 97% di confidenza che la variante B sia migliore. Rilasci il nuovo titolo e ti aspetti un aumento coerente.
Perché la significatività statistica è più importante del solo tasso di conversione
Il tasso di conversione ti dice cosa è successo. La significatività statistica ti dice se continuerà a succedere. Un tasso di conversione del 10% che oscilla tra l'8% e il 12% giorno dopo giorno è meno utile di un tasso stabile del 9% con intervalli di confidenza stretti.
Google ha eseguito 12.000 A/B test nel 2023 e ha scoperto che il 30% dei test dichiarati "vincitori" anticipatamente si sarebbe invertito se fossero stati eseguiti più a lungo. I team si sono fermati a 1.000 visitatori per variante perché la variante B era in vantaggio del 15%. Il p-value era 0,12 (88% di confidenza, non 95%). Quando hanno lasciato il test funzionare a 5.000 visitatori, la variante A si è portata in testa. Dichiararlo anticipatamente significava semplicemente dichiararlo in modo errato.
La dimensione del campione determina se puoi fidarti del risultato. Test piccoli (meno di 500 conversioni totali) producono intervalli di confidenza ampi, il che significa che il vero tasso di conversione potrebbe essere ovunque in un intervallo ampio. Test grandi (oltre 5.000 conversioni) producono intervalli stretti, il che significa che conosci il vero tasso entro pochi decimali. Il calcolatore mostra sia gli intervalli che la dimensione del campione consigliata, quindi sai quando fermarti.
Eseguire la matematica cambia le tue abitudini di test. Smetti di dichiarare vincitori sulla base dell'intuito: un aumento del 20% non significa nulla se il p-value è 0,15. Smetti di eseguire test oltre la significatività: una volta raggiunto p < 0,05 e la dimensione del campione consigliata, hai la tua risposta. E smetti di interrompere i test troppo presto, perché una variante che è dietro dopo 1.000 visitatori non ha effettivamente perso ancora.
Errori comuni
- Fermare i test troppo presto. Una variante si porta in vantaggio dopo 500 visitatori, quindi la dichiari e passi oltre. Il problema è che 500 visitatori raramente producono significatività statistica a meno che la differenza nel tasso di conversione non sia massiccia (come il 2% rispetto al 6%). Lascia che il test funzioni fino a quando il p-value scenda sotto 0,05 o raggiungi la dimensione del campione consigliata.
- Ignorare l'intervallo di confidenza. Due varianti potrebbero avere tassi di conversione diversi ma intervalli di confidenza sovrapposti, il che significa che la differenza non è reale. Controlla sempre che gli intervalli siano separati prima di dichiarare un vincitore.
- Testare troppe varianti contemporaneamente. L'esecuzione di test A/B/C/D divide il traffico in quattro modi, il che significa che ogni variante ha bisogno di quattro volte più visitatori per raggiungere la significatività. Attieniti ai test A/B a meno che tu non abbia traffico massiccio.
- Modificare il test durante l'esecuzione. Inizi a testare un titolo, poi a metà percorso cambi anche il colore del pulsante. Ora non sai quale cambiamento ha causato la differenza. Testa una variabile alla volta o usa strumenti di test multivariato progettati per più cambiamenti.
- Non usare lo stesso periodo di tempo. Esecuzione della variante A di lunedì e della variante B di venerdì introduce bias di giorno della settimana. La qualità del traffico, l'intenzione dell'utente e i tassi di conversione variano a seconda del giorno. Esegui entrambe le varianti contemporaneamente con traffico diviso al 50/50.
- Confondere la significatività statistica con l'impatto commerciale. Un test può essere statisticamente significativo ma economicamente insignificante. Un aumento dello 0,1% su un prodotto a basso margine potrebbe non coprire il costo di implementazione. Usa il calcolatore del tasso di conversione per proiettare l'impatto sulla ricavi prima di rilasciare.
Suggerimenti avanzati
- Combina questo calcolatore con il calcolatore del tasso di conversione per tradurre i miglioramenti percentuali in ricavi. Se la variante B aumenta la conversione dal 4% al 4,8% e ricevi 100.000 visitatori al mese, sono 800 conversioni aggiuntive. Moltiplica per il valore medio dell'ordine per vedere l'impatto in dollari.
- Usa la dimensione del campione consigliata per stimare la durata del test. Se hai bisogno di 15.000 visitatori per variante per raggiungere la significatività e ricevi 5.000 visitatori al giorno, il test deve funzionare un minimo di sei giorni (15.000 × 2 varianti ÷ 5.000 al giorno).
- Per i test sequenziali (testare il vincitore contro un nuovo sfidante), reimposta il calcolatore. Non trasportare dati dal test precedente. Ogni test è indipendente e ha bisogno della propria dimensione del campione per risultati validi.
- Traccia la significatività nel tempo ricalcolando quotidianamente. Esporta il p-value e gli intervalli di confidenza in un foglio di calcolo in modo che tu veda il momento in cui il test supera la soglia di confidenza del 95%. Questo previene chiamate premature e conferma quando hai raccolto abbastanza dati.
- Per test con traffico basso, abbassa la tua soglia di significatività da 0,05 a 0,10 (90% di confidenza). Questo è più rischioso ma necessario quando aspettare il 95% di confidenza richiederebbe mesi. Documenta il compromesso e aspettati più falsi positivi.
- Se un test funziona per settimane e mai raggiunge la significatività, le varianti sono probabilmente troppo simili. La differenza nel tasso di conversione è così piccola che rilevarla richiede dimensioni di campione non realistiche. Dichiaralo una parità e testa un cambiamento più grande.
Una volta determinata la significatività statistica, il passo successivo è capire da dove provengono le conversioni. Usa il calcolatore CTR per suddividere i tassi di click-through per fonte di traffico, dispositivo o campagna. Se stai testando le righe dell'oggetto delle email, il tasso di conversione mostra chi ha agito dopo l'apertura, ma il CTR mostra chi ha aperto in primo luogo. Per i flussi di lavoro di ottimizzazione della pagina di destinazione, questo calcolatore conferma se un cambiamento ha funzionato, il calcolatore del tasso di conversione proietta l'impatto sui ricavi e il generatore di titoli ti aiuta a scrivere la prossima variante da testare.