A/B Test Dashboard

← Back to skills

> Track experiments, measure results, and make data-driven decisions.

Category: Security & Reliability
Repo: nguyenphp-antigravity-marketing
Path: templates/.agent/skills/ab-test-dashboard/SKILL.md
Updated: 4/20/2026, 12:45:47 PM
Open on GitHubHow to Install

AI Summary

> Track experiments, measure results, and make data-driven decisions. It is useful for security auditing, threat modeling, reliability testing, incident response, and production hardening. Source: nguyenphp-antigravity-marketing (templates/.agent/skills/ab-test-dashboard/SKILL.md).

A/B Test Dashboard

Track experiments, measure results, and make data-driven decisions.


🎯 What This Skill Does

CapabilityDescription
Design TestsStructure proper A/B experiments
Track ResultsMonitor test performance
Calculate StatsStatistical significance checks
Visualize DataDashboard creation
Report FindingsCommunicate results clearly

1. A/B Test Basics

What is an A/B Test?

TermMeaning
Control (A)Your current version
Variant (B)The change you're testing
Sample sizeNumber of visitors needed
SignificanceConfidence results aren't random
ConversionThe action you're measuring

What to Test (Priority)

High ImpactMedium ImpactLow Impact
HeadlinesButton textFont size
CTAsImagesColors
PricingForm fieldsSpacing
OffersLayoutIcons
Landing pagesNavigationAnimations

2. Sample Size Calculator

Quick Formula

Sample Size = (ZΒ² Γ— p Γ— (1-p)) / EΒ²

Where:
- Z = 1.96 for 95% confidence
- p = expected conversion rate
- E = margin of error (Β±)

Simple Reference Table

Current RateLift to DetectSample per Variation
1%20%~40,000
2%20%~20,000
5%20%~8,000
10%15%~4,000
20%10%~3,000

Online Calculators

ToolURL
Optimizelyoptimizely.com/sample-size-calculator
AB Tastyabtasty.com/sample-size-calculator
Evan Millerevanmiller.org/ab-testing/sample-size

3. Dashboard Metrics

Core Metrics to Track

MetricFormula
Conversion RateConversions / Visitors Γ— 100
Relative Lift(B - A) / A Γ— 100
Confidence LevelStatistical p-value calculation
Visitors per DayTotal visitors / Days running
Days to SignificanceRequired sample / Daily visitors

Dashboard Layout

β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”
β”‚  TEST: [Name]                Status: RUNNING β”‚
β”œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€
β”‚                                             β”‚
β”‚   Control (A)        Variant (B)            β”‚
β”‚   β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”       β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”            β”‚
β”‚   β”‚  2.5%   β”‚       β”‚  3.1%   β”‚            β”‚
β”‚   β”‚  Conv   β”‚       β”‚  Conv   β”‚            β”‚
β”‚   β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜       β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜            β”‚
β”‚                                             β”‚
β”‚   Visitors: 5,432    Visitors: 5,489       β”‚
β”‚   Conversions: 136   Conversions: 170      β”‚
β”‚                                             β”‚
β”‚   ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━      β”‚
β”‚   Lift: +24%    Confidence: 87%            β”‚
β”‚   ⚠️ Not yet significant (need 95%)        β”‚
β”‚                                             β”‚
β”œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€
β”‚  Progress: β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‘β–‘β–‘β–‘β–‘β–‘ 68% complete      β”‚
β”‚  Est. completion: 4 more days               β”‚
β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜

4. Statistical Significance

What Does It Mean?

ConfidenceMeaning
95%5% chance results are random (standard)
99%1% chance results are random (high stakes)
90%10% chance results are random (quick tests)

Quick Significance Check

ScenarioLikely Significant?
Big difference + many visitorsβœ… Yes
Small difference + few visitors❌ No
Big difference + few visitors⚠️ Wait
Small difference + many visitors⚠️ Maybe real, but small

Avoid Common Mistakes

MistakeProblemSolution
Stopping earlyFalse positivesWait for sample size
Peeking too muchBias decisionsSet check schedule
Testing too many thingsCan't attribute causeOne change at a time
Running too shortMisses weekly patternsRun 1-2 full weeks

5. Simple Dashboard with Google Sheets

Setup Steps

1. Create new Google Sheet
2. Tab 1: Raw data (date, variant, visitors, conversions)
3. Tab 2: Summary calculations
4. Tab 3: Charts

Formula Examples

MetricGoogle Sheets Formula
Conversion Rate A=SUMIF(B:B,"A",D:D)/SUMIF(B:B,"A",C:C)
Conversion Rate B=SUMIF(B:B,"B",D:D)/SUMIF(B:B,"B",C:C)
Lift=(B_Rate-A_Rate)/A_Rate
Daily Visitors=SUMIF(A:A,TODAY()-1,C:C)

Simple Significance Formula

For approximation (use proper calculator for real tests):

Z = (pB - pA) / SQRT(p*(1-p)*(1/nA + 1/nB))

Where:
- pA, pB = conversion rates
- p = pooled rate = (convA + convB) / (nA + nB)
- nA, nB = sample sizes

If |Z| > 1.96, result is significant at 95%

6. Test Documentation

Pre-Test Template

## Test: [Name]

### Hypothesis
If we [change], then [metric] will [improve] because [reason].

### Test Details
- Page/Element: 
- Control: [Description]
- Variant: [Description]
- Primary metric: 
- Secondary metrics:

### Sample Size
- Current conversion rate: X%
- Minimum detectable effect: Y%
- Required visitors per variant: Z

### Timeline
- Start date:
- Expected end date:
- Check-in dates:

Post-Test Template

## Test Results: [Name]

### Summary
- Winner: [Control/Variant/No difference]
- Confidence: X%
- Lift: +/-Y%

### Data
| Metric | Control | Variant | Lift |
|--------|---------|---------|------|
| Visitors | | | |
| Conversions | | | |
| Conv Rate | | | |

### Learning
What did we learn?

### Next Steps
- Implement winner?
- Follow-up test?
- Share with team?

7. Tools for A/B Testing

Free/Cheap Tools

ToolBest ForCost
Google OptimizeWebsites (sunset, but alternatives exist)Free
SplitbeeSimple testsFree tier
GrowthbookOpen sourceFree
PosthogFeature flags + analyticsFree tier

Paid Tools

ToolBest ForCost
VWOFull CRO platform$199+/mo
OptimizelyEnterprise$$$$
AB TastyMid-market$$$
ConvertSMB friendly$99+/mo

8. Visualization Best Practices

Chart Types

DataChart Type
Rate comparisonBar chart
Trend over timeLine chart
Sample progressProgress bar
Segment breakdownPie/donut
Confidence rangeError bars

Dashboard Colors

StatusColor
Winning (significant)Green
Losing (significant)Red
Running (not significant)Yellow/Gray
WinnerBlue (neutral)

Remember: Statistical significance β‰  practical significance. Always ask: "Is this lift worth the effort to implement?"

Related skills