Het korte antwoord
Een A/B test is een meetinstrument dat een minimale hoeveelheid verkeer nodig heeft om betrouwbaar te zijn. Zit je daaronder, dan levert testen geen antwoord op maar ruis die eruitziet als een antwoord. Voor de meeste dienstverleners en organisaties in Nederland begint conversieoptimalisatie daarom bij diagnose, niet bij experimenteren.
Waarom deze vraag terugkomt
Je stelde het zelf al eens zo: is conversieoptimalisatie niet gewoon het doel van elke marketeer? Dat klopt ook. Iedereen wil dat er meer bezoekers klant worden. Het verschil zit niet in het doel maar in de methode, en juist daar wordt de term het vaakst opgerekt.
Veel partijen gebruiken conversieoptimalisatie als synoniem voor A/B testen. Twee versies van een pagina, verkeer verdelen, kijken welke wint. Dat is een prachtige methode, mits je aan de voorwaarden voldoet.
De voorwaarde die vaak wordt overgeslagen
Een test moet genoeg waarnemingen hebben om een verschil te kunnen aantonen dat er echt is. Hoeveel dat er zijn hangt af van je huidige conversiepercentage en van hoe klein het verschil is dat je nog wilt kunnen zien.
Dat laatste heet de minimaal detecteerbare verandering. Wil je een verbetering van twintig procent kunnen aantonen, dan heb je aanzienlijk minder verkeer nodig dan wanneer je een verbetering van twee procent wilt kunnen aantonen. En juist bij pagina's die al redelijk werken, zijn de realistische verbeteringen klein.
Onderzoek naar de praktijk van experimenteren laat zien hoe streng die voorwaarde uitpakt. Slechts ongeveer een vijfde van de uitgevoerde experimenten haalt het gebruikelijke significantieniveau van 95 procent. En bij een analyse van testideeën bleek minstens dertig procent daarvan een looptijd van zes maanden nodig te hebben, gegeven het beschikbare verkeer.
Wat er misgaat als je het toch doet
Het gevaarlijke aan een ondermaatse test is niet dat hij niets oplevert. Het is dat hij wel iets oplevert.
Met te weinig waarnemingen schommelt het verschil tussen twee versies flink. Op enig moment staat versie B voor, en als je dan stopt en de winnaar uitroept, heb je een uitkomst die op toeval berust. Erger nog: die uitkomst voelt als bewijs, en dus wordt hij de basis voor de volgende beslissing.
Zo bouw je een reeks aanpassingen op ruis, met de overtuiging dat je datagedreven bezig bent.
Wat je in plaats daarvan doet
Als testen geen betrouwbaar instrument is voor jouw verkeersvolume, blijft de vraag staan: waarom haken mensen af? Die vraag is uitstekend te beantwoorden zonder experiment.
Het pad in kaart brengen
Waar in het traject van eerste bezoek tot aanvraag verdwijnen mensen? Dit is beschrijvende data en heeft geen significantie nodig. Als negen van de tien mensen op stap drie afhaken, weet je genoeg om te weten waar je moet kijken.
Kijken hoe mensen het echt gebruiken
Vijf mensen die je formulier proberen in te vullen terwijl je meekijkt, leveren vaak meer bruikbare informatie op dan een test die drie maanden loopt. Je ziet waar ze aarzelen en waar ze iets anders verwachten dan er staat.
Het gesprek gebruiken dat je al voert
De vragen die je in een kennismakingsgesprek steeds opnieuw krijgt, zijn de vragen die je site niet beantwoordt. Dat is gratis onderzoek dat je al doet zonder het zo te noemen.
De obstakels wegnemen die je gewoon kunt zien
Een formulier met twaalf verplichte velden, een laadtijd die te lang is, een prijsvraag die nergens beantwoord wordt: daar heb je geen test voor nodig. Dat zijn geen hypotheses maar gebreken.
Wanneer testen wel het juiste instrument is
Testen is niet fout, het is voorwaardelijk. Het wordt zinvol zodra je genoeg verkeer hebt om een realistische verbetering binnen een redelijke termijn aan te kunnen tonen, en wanneer de makkelijke gebreken al verholpen zijn.
Op dat punt verandert de vraag ook van aard. Dan gaat het niet meer over of iets kapot is, maar over welke van twee redelijke opties beter werkt. Dat is precies waar een test voor gemaakt is.
Hoe wij het aanpakken
We beginnen met de diagnose en zeggen erbij hoeveel verkeer je zou hebben voor een betrouwbare test. Vaak is dat een ontnuchterend gesprek, en het is beter om dat aan het begin te voeren dan na drie maanden testen zonder uitsluitsel.
Zit je onder die grens, dan werken we met wat wel houdbaar is: het pad in kaart, de knelpunten benoemd, en de aanpassingen die geen bewijslast nodig hebben omdat het simpelweg gebreken zijn.
We beginnen met de diagnose: waar haken mensen af en waarom. Testen komt pas in beeld als er genoeg verkeer is om een uitkomst te vertrouwen.
- Convert, Understanding statistical significance in A/B testing. Bron van het aandeel experimenten dat 95 procent significantie haalt
- Analytics Toolkit, Statistical power, MDE, and designing statistical tests
- Analytics Toolkit, What is a minimum detectable effect (MDE)?