A/B Testi Rehberi: Reklam ve Site Testlerinde Doğru Metodoloji

Güncellendi: 8 dk okuma

A/B testi, pazarlamada tahmin yerine ölçüm koyan ve aynı trafikle dönüşümü artıran bilimsel yöntemdir; ancak yanlış metodoloji, yanlış kararlar üretir ve “test ediyoruz” hissiyle gerçek kaybı gizler. Diyez Media deneyimimde, örneklem yetersizliği ve çok değişkenli test yüzünden yanlış sonuçlanan onlarca test gördüm; istatistiksel anlamlılığa ulaşmadan verilen kararlar, iyi fikirleri öldürüp kötü fikirleri kalıcılaştırır. Bu eğitimde hipotez kurma, örneklem hesabı, tek değişken prensibi ve anlamlılık okumayı adım adım işliyoruz.

A/B testi nedir ve hangi durumlarda yapılmalıdır?

A/B testi, bir sayfanın veya reklamın iki varyasyonunun (A kontrol, B deneme) gerçek kullanıcılara eşit olarak gösterilip, önceden tanımlı metrikteki farkın istatistiksel olarak anlamlı olup olmadığının ölçülmesidir. Testin doğru olduğu durumlar:

  • Yeterli trafik var: Aylık en az 5.000-10.000 ziyaretçi; düşük trafikte sonuç almak aylar sürer.
  • Tek soru net: “Buton rengi mi, başlık mı, form uzunluğu mu?” sorusunun tek bir cevabı aranır.
  • Karar etkili: Test edilen değişiklik, dönüşüm veya maliyet üzerinde kayda değer etki yaratacak büyüklükte.
  • Ölçüm altyapısı hazır: GA4 ve dönüşüm izleme doğru çalışıyor; ölçüm bozuksa test sonucu güvenilmezdir.

A/B testi yapılmaması gereken durumlar da nettir: trafiği düşük sayfalarda, reklam panellerindeki küçük görsel değişikliklerde ve dönüşüm izlemesi doğrulanmamış hesaplarda test, zaman ve bütçe kaybıdır. Kural: “Ölçülebilir bir fark yaratmayacaksa test etme.”

Test hipotezi nasıl kurulmalıdır?

Hipotez, testin mantıksal çatısıdır; “Acaba buton kırmızı mı olsa?” yerine, veriye dayalı ve test edilebilir bir ifade gerekir. Hipotez formülü şudur:

  • Gözlem: Isı haritasında kullanıcıların %70’i butonu görmüyor.
  • Neden: Buton, katlama çizgisinin altında ve sayfa sonunda.
  • Çözüm: Butonu yukarı taşıyalım.
  • Beklenen etki: Tıklama oranı %1,2’den %1,8’e çıkacak (60 günlük tahmin).
  • Ölçüm: Buton tıklama oranı ve form dönüşüm oranı.

İyi hipotez üç veri kaynağından beslenir: analitik veri (GA4, Search Console), kullanıcı davranışı (ısı haritası, oturum kayıtları) ve müşteri geri bildirimi (anket, yorumlar). Hipotez yazılı hale getirilmeden teste başlamayın; “deneyelim bakalım” kültürü, sonuçları yorumlanamaz hale getirir. Her testin tek bir hipotezi ve tek bir ölçüm metriği olmalıdır.

Örneklem büyüklüğü nasıl hesaplanır ve neden kritiktir?

Örneklem büyüklüğü, testin güvenilirliğini belirler; yetersiz örneklem, rastlantısal farkları gerçek fark sanmanıza neden olur. Hesap üç bileşene bağlıdır:

  • Mevcut dönüşüm oranı (baz oran): Örneğin %2.
  • Tespit etmek istediğiniz minimum etki (MDE): Örneğin %20 göreceli iyileşme, yani %2 → %2,4.
  • Güven düzeyi ve istatistiksel güç: Standart olarak %95 güven ve %80 güç.

Pratik kural olarak, %2 baz oranı ve %20 etki için varyasyon başına yaklaşık 20.000-30.000 ziyaretçi gerekir; bu da günlük 1.000 ziyaretçiyle 20-30 gün sürer. Ücretsiz araçlar olan VWO’nun örneklem hesaplayıcısı, Optimizely’nin hesap makinesi ve çevrimiçi hesaplayıcılar (Evan Miller) süreci kolaylaştırır. Örneklemi hesaplamadan başlayan test, bitmeye yakın “acaba yeterli mi” sorusuyla karşılaşır; önceden belirlenen gün sayısına sadık kalın.

Aynı anda tek değişken prensibi neden zorunludur?

Çoklu değişkeni aynı anda değiştirmek, testi yorumlanamaz hale getirir: Dönüşüm arttıysa hangi değişikliğin etkisi olduğunu bilemezsiniz. Gerçek bir vaka ile açıklayalım: Bir e-ticaret sitesi, buton rengini ve başlığı aynı anda değiştirdi; dönüşüm %1,8’den %2,3’e çıktı. Şirket kırmızı butonu ölçekledi; dönüşüm geriledi çünkü artışın kaynağı başlık değişikliğiydi. Tek değişken prensibi bunu önler:

  • Bir testte yalnızca bir öğe değişir; diğer her şey sabit kalır.
  • Öğenin birden çok seviyesi varsa (3 renk, 2 başlık), A/B/n testi kurulur; her varyasyon tek değişkende farklıdır.
  • Sıralı bağımlılıklarda (form adımları gibi) değişiklik grupları için önce adım bazlı test yapılır.

Tek değişken prensibi, test sonuçlarını birikimli bilgiye dönüştürür: her test, öğe bazlı bir öğrenme üretir ve bu öğrenmeler gelecek testlerin hipotezlerini besler.

İstatistiksel anlamlılık nasıl yorumlanır ve karar hatalarından nasıl kaçınılır?

İstatistiksel anlamlılık, gözlenen farkın rastlantıdan kaynaklanma olasılığının düşük olduğunu gösterir; %95 güven, %5 hata payı demektir. Yorumlama kuralları:

DurumYorumKarar
%95 üzeri anlamlılık + pozitif farkGerçek iyileşmeVaryasyonu ölçekle
Anlamlılık %95 altı + fark varYetersiz veriTesti sürdür, veri topla
Test bitiş günü geldi + anlamlılık yokFark yok veya çok küçükKontrolü koru, yeni hipotez
Fark negatif + anlamlıGerçek kötüleşmeTesti erken durdur, kontrolü koru

Sık yapılan karar hataları: testi erkenden kazanan ilan etmek (örneklem yetersizken), “peeking” yani her gün sonuca bakıp karar değiştirmek ve anlamlılık eşiğini düşürüp %80’de “yeter” demek. Bu hataların ortak kaynağı sabırsızlıktır; test süresi baştan hesaplanmalı, bitiş gününden önce sonuç paneline bakılmamalıdır.

Test önceliklendirme: Hangi testler önce yapılmalıdır?

Test kuyruğu, etki ve kolaylık dengesine göre sıralanır; PIE çerçevesi en pratik araçtır. Her aday test, üç boyutta 1-10 puanlanır:

  • Potansiyel (Potential): Trafik ve dönüşüm üzerindeki etki büyüklüğü.
  • Önem (Importance): Testin hedef metrikle ve iş sonucuyla ilgisi.
  • Kolaylık (Ease): Uygulama maliyeti ve süresi.

Skor (Potansiyel + Önem + Kolaylık) / 3 ile hesaplanır; en yüksek puanlı test önce yapılır. Örneğin ana sayfa başlığı testi (potansiyel 9, önem 9, kolaylık 9 = 9,0) ile form alan sayısı testi (8, 8, 5 = 7,0) karşılaştırıldığında öncelik açıktır. Ayrıca hunide “en çok sızıntı olan aşama” önceliklidir: Sepette %70 terk varsa, oradaki testler ürün sayfasındakilerden önce gelir. Ayda 2-4 test gerçekçi bir hızdır; 10 test başlatmak, veri bölünmesiyle tüm sonuçları geciktirir.

Hangi A/B testi araçları kullanılmalıdır?

Test aracı seçimi, teknik kapasite ve bütçeye göre yapılır; 2026’da Google Optimize kapatıldığı için alternatifler öne çıkmıştır:

AraçMaliyetGüçlü YönKimin İçin
VWOÜcretli (aylık ~$100+)Görsel editör, örneklem hesabı, ısı haritasıKOBİ ve ajanslar
OptimizelyKurumsalÖlçek, çok varyasyonlu test, entegrasyonBüyük ekipler
ConvertÜcretliSunucusuz kurulum, GDPR uyumuGizlilik odaklı markalar
Google Ads varyasyonlarıÜcretsizReklam metni testi, otomatik anlamlılıkReklam optimizasyonu
GA4 ExperimentsÜcretsizRastgeleleştirme + GA4 raporlamaSıfır bütçe başlangıç

Araçtan bağımsız kurallar: rastgeleleştirme doğru çalışmalı, çerez engelleyiciler deneyi bozmamalı ve test kodları sayfa hızını etkilememelidir. Küçük bütçeyle başlayanlar GA4 Experiments + Google Ads varyasyonları ile başlayıp, veri biriktirdikçe VWO sınıfı araçlara geçebilir.

Test döngüsü ve raporlama nasıl kurulmalıdır?

A/B testi tek seferlik bir aksiyon değil, sürekli iyileştirme döngüsüdür. Aylık döngü şöyle işler:

  1. Hafta 1 – Keşif: Analitik, ısı haritası ve anket verisinden 5-10 test adayı çıkarın, PIE ile sıralayın.
  2. Hafta 1 – Kurulum: İlk 2 testin hipotezini yazın, örneklem hesabını yapın, testi yayına alın.
  3. Hafta 2-3 – Çalışma: Teste müdahale etmeyin; önceden belirlenen süre dolmadan sonuca bakmayın.
  4. Hafta 4 – Karar: Sonuçları anlamlılıkla yorumlayın; kazananı ölçekleyin, kaybedeni arşivleyin.
  5. Ay sonu – Rapor: Kazananların toplam etkisini (tahmini ek dönüşüm ve gelir) yönetime tek sayfayla sunun.

Raporlama dilinde “buton kırmızı kazandı” yerine “form dönüşümü %2,1’den %2,5’e çıktı; aylık tahmini 42 ek müşteri adayı” ifadesi kullanılır. Test günlüğü tutun: her testin hipotezi, süresi, örneklemi ve sonucu kaydedilir; bu günlük, ekip değişse bile kurumsal öğrenmeyi korur.

Test sonuçları nasıl ölçeklenir ve test kültürü nasıl kurumsallaştırılır?

Kazanan testi yayınlamak, işin yalnızca yarısıdır; kazanımın kalıcı olması için ölçekleme ve kurumsallaştırma gerekir. Ölçekleme adımları:

  1. Kazanımı doğrulayın: Kazanan varyasyonu 1-2 hafta tüm trafikte çalıştırın; A/B sonucundaki kazanımın yayın sonrası korunduğunu teyit edin.
  2. Benzer alanlara taşıyın: Başlık testi kazandıysa, aynı prensibi diğer sayfa başlıklarına uygulayın; ancak her taşıma için küçük bir doğrulama testi yapın.
  3. Kazanımı gelir diline çevirin: Dönüşüm artışını aylık tahmini gelire çevirin; bu, test kültürünün yönetim desteğini güçlendirir.
  4. Bilgi deposu kurun: Test günlüğüne hipotez, veri, sonuç ve çıkarımları işleyin; 6 ayda bir depoyu tarayıp yeni test hipotezleri üretin.
  5. Standart süreç tanımlayın: “Öneri → hipotez → test → karar → yayın” zincirini onay akışına bağlayın; test etmeyen ekipler, gerekçeli olarak etmesi gerektiğini açıklar.

Kurumsal test kültürünün belirtisi, kararların “bence” yerine “test sonucu” ile savunulmasıdır. Bu kültür yerleştiğinde, pazarlama ekibi her ayda birkaç kalıcı iyileşme üretir; yıllık toplamda dönüşüm oranındaki iyileşme, reklam bütçesinin birkaç katına denk gelir.

Sonuç

A/B testi, hipotezden anlamlılığa uzanan disiplinli bir metodolojidir: tek değişken değiştiren, örneklemi baştan hesaplayan, önceden tanımlı sürede çalışan ve sonucu %95 güvenle okuyan bir test kültürü, pazarlama kararlarını tahminden veriye taşır. Kazananları ölçekleyin, kaybedenleri arşivleyin, öğrenmeleri test günlüğünde biriktirin; 6-12 ayda dönüşüm oranınızda kalıcı iyileşme görürsünüz. Test kültürünü kurmak ve dönüşüm huninizi veriyle büyütmek için dönüşüm oranı optimizasyonu (CRO) hizmetlerimizi ve dijital pazarlama danışmanlığı sayfamızı inceleyebilirsiniz.

Son güncelleme: Ağustos 2026. Test araçları ve istatistiksel standartlardaki güncellemelere göre bu eğitim yıllık revize edilir; güncel pratikler için Cuma Bozkurt blogunu takip edin.

Sık Sorulan Sorular

A/B testi ne kadar süre çalışmalıdır?

Test süresi, örneklem hesabına göre belirlenir; genel kural, hafta içi ve hafta sonu davranış farkını yakalamak için en az 2 tam hafta, tercihen 3-4 haftadır. Hafta sonu trafiği ağırlıklı e-ticarette bu fark kritiktir. Süre dolmadan sonuca bakmak, yanlış karar üretir; süreyi uzatmak ise kullanıcıların varyasyonlara alışmasıyla duyarlılığı düşürür. Hedef süre: örneklemin öngörülen gün sayısı.

Dönüşüm oranı düşük sayfada A/B testi yapılabilir mi?

Yapılabilir ancak dikkatli olunmalıdır: düşük trafik veya düşük dönüşüm oranı, örneklem süresini katlayarak uzatır; %0,5 dönüşüm oranında anlamlı sonuç aylar sürebilir. Bu durumda önce dönüşüm oranını yükseltecek temel iyileştirmeler (sayfa hızı, teklif netliği) yapılır, sonra test başlatılır. Alternatif olarak, kullanıcı davranışı metriğini (tıklama, kaydırma) ara test metriği olarak kullanın.

A/B testinde aynı anda kaç test çalışmalıdır?

Aynı sayfada aynı anda birden fazla test çalıştırmak, kullanıcıların birden çok varyasyona maruz kalmasına yol açar ve sonuçları birbirine karıştırır; aynı sayfada tek test kuralı geçerlidir. Farklı sayfalarda (ana sayfa + ürün sayfası) eş zamanlı testler sorun değildir. Aynı kitle hedefli reklam testleri de site testleriyle senkronize edilmeli; toplam test sayısını veri derinliğine göre 2-3 ile sınırlayın.

Test kazanan varyasyon herkes için mi geçerli?

Kazanan varyasyon, test edilen kitlenin ortalaması için geçerlidir; segmentler farklı davranabilir: mobil kullanıcılar için kazanan A, masaüstü için B olabilir. Test sonrası segment kırılımını (cihaz, trafik kaynağı, yeni/dönüşen) kontrol edin. Segment farkı büyükse, hedefleme bazlı farklı varyasyonları ölçekleyin; bu durum ileri seviye kişiselleştirmenin de temelini oluşturur.

İstatistiksel olarak anlamlı çıkmayan test ne anlama gelir?

İki olası anlamı vardır: değişiklik gerçekten etkisizdir ya da örneklem etkiyi tespit edemeyecek kadar küçüktür. Ayrımı yapmak için örneklem hesabınızı kontrol edin; hesap doğruysa varyasyon etkisizdir ve yayınlanmamalıdır. “Anlamlı değil” sonucu da bir bilgidir: kayıptan kaçınılmıştır. Bu öğrenme, aynı öğe için yeni hipotezlerin yönünü belirler.

Bu rehber 26 Ağustos 2026 tarihinde gözden geçirildi.

Bu konudaki diğer rehberler

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir