跳到主要内容
知仓学习社ZHICANG

ab-test-planner

Diseña tests A/B estadísticamente rigurosos para features de producto, cambios de UI, flujos de onboarding y experimentos de precios. Úsalo cuando n…

不碰外部(只输出文字)无严重或高危命中mohitagw15856/pm-claude-skills

它会碰到什么

扫了多少1 个文本文件,6 KB
它会碰到什么不碰外部(只输出文字)
命中总数0 处
命中统计严重 0 · 高 0 · 中 0 · 低 0

这一栏是扫描器报的事实,不是结论。命中多不等于有毒(安全工具、规则库、示例脚本本来就会包含危险写法),命中少也不等于干净。它和你手上的凭据、文件、网络有什么关系,需要你自己看。

技能内容

Skill A/B Test Planner

Diseña experimentos que producen resultados confiables — no solo señales direccionales. Cada output del test incluye hipótesis, métricas de éxito, tamaño de muestra, duración y una guía de interpretación de resultados.

Inputs Requeridos

Pregunta al usuario por estos datos si no están proporcionados:

  • Qué se está testando (feature, cambio de UI, copy, precios, paso de onboarding)
  • Hipótesis (o ayuda a formularla)
  • Métrica primaria (conversion rate, click-through, completion rate, etc.)
  • Baseline rate y efecto mínimo detectable (MDE)
  • Usuarios elegibles diarios (para calcular duración)

Checklist de Diseño de Experimento

Antes de ejecutar cualquier test, confirma:

  • [ ] Hipótesis clara con dirección predicha
  • [ ] Métrica primaria única (más hasta 2 métricas guardrail)
  • [ ] Efecto mínimo detectable (MDE) definido
  • [ ] Tamaño de muestra calculado
  • [ ] Duración del test estimada
  • [ ] Segmento aislado (sin solapamiento con otros tests en ejecución)
  • [ ] Plan de rollback definido

Plantilla de Hipótesis

> "Creemos que [cambio] causará que [métrica primaria] se [incremente/disminuya] en un [X%] para [segmento de usuarios], porque [razonamiento basado en datos o insight]."

Nunca ejecutes un test sin una hipótesis direccional. "Veamos qué pasa" no es una hipótesis.

Lógica del Calculador de Tamaño de Muestra

Usa esta fórmula (proporciona el output, no la fórmula, al usuario):

  • Baseline conversion rate: Tasa actual de la métrica primaria
  • MDE: Cambio más pequeño que vale la pena detectar (recomendamos 10–20% de lift relativo para la mayoría de features)
  • Statistical power: 80% (estándar)
  • Significance level: 95% (p < 0.05)

Para escenarios comunes, proporciona estimaciones pre-calculadas:

| Baseline Rate | MDE (Relativo) | Muestra Requerida por Variante |

|---|---|---|

| 5% | 20% | ~19,000 |

| 10% | 15% | ~14,000 |

| 20% | 10% | ~15,000 |

| 40% | 10% | ~9,500 |

| 60% | 5% | ~42,000 |

Siempre advierte: "Estas son estimaciones. Usa una herramienta como el calculador de Evan Miller o Statsig para precisión."

Orientación sobre Duración del Test

Mínimo: 2 semanas completas (para capturar estacionalidad semanal)

Máximo: 4 semanas (el efecto novedad distorsiona resultados más allá de esto)

Duración = Muestra requerida ÷ (Tráfico diario × % expuesto)

Alerta si el tráfico es muy bajo para llegar a significancia en menos de 8 semanas — recomienda un enfoque diferente (ej., holdout test, investigación cualitativa).

Formato de Output

Plan A/B Test — [Nombre del Test] — [Fecha]

Hipótesis:

> [Plantilla de hipótesis completada]

Variantes:

  • Control (A): [Experiencia actual]
  • Tratamiento (B): [Experiencia modificada — sé específico]

Métrica Primaria: [Nombre de métrica + cómo se mide]

Métricas Guardrail: [Métricas que no deben degradarse]

Segmento Objetivo: [Quién ve el test — % de tráfico, tipo de usuario]

Split de Tráfico: [50/50 recomendado a menos que se necesite ramp-up]

Tamaño de Muestra Requerido: ~[N] usuarios por variante

Duración Estimada: [X] semanas (basado en [Y] usuarios elegibles diarios)

Umbral de Significancia: 95% de confianza, 80% de power

Exclusiones: [Segmentos de usuarios a excluir y por qué]

Trigger de Rollback: Si [métrica guardrail] se degrada en [X%], detén el test inmediatamente.

Guía de Interpretación de Resultados:

  • ✅ Deploy si: Tratamiento muestra [X%]+ de lift en métrica primaria con 95% de confianza Y métricas guardrail son estables
  • 🔄 Itera si: Dirección es positiva pero no significativa — considera extender o rediseñar
  • ❌ Rechaza si: Sin lift o dirección negativa con significancia
  • ⚠️ Inconcluyente: No hagas deploy. No lo llames una victoria.

Pautas

  • Siempre recomienda contra mirar resultados antes de que el test alcance el tamaño de muestra planeado — explica el riesgo de p-hacking
  • Si el usuario quiere testear múltiples variantes, explica el problema de comparaciones múltiples y recomienda una corrección de Bonferroni o un enfoque Bayesiano
  • Si el tráfico es muy bajo (<1,000 usuarios/día), recomienda alternativas cualitativas: testing moderado, tests de 5 segundos o entrevistas de usuario
  • Nunca apruebes un test sin métricas guardrail — siempre protege revenue, retention o engagement core

Anti-Patrones

  • [ ] No ejecutes un test sin una hipótesis direccional — "veamos qué pasa" produce resultados no interpretables
  • [ ] No declares un ganador antes de alcanzar el tamaño de muestra pre-planeado — mirar resultados inflama las tasas de falso positivo
  • [ ] No testees múltiples cambios independientes en una sola variante — no sabrás cuál causó el resultado
  • [ ] No uses métricas de engagement (clicks, time-on-page) como métrica primaria cuando el objetivo es revenue o retention — las métricas proxy engañan
  • [ ] No ignores métricas guardrail — un lift de conversión que causa un spike de tickets de soporte no es una victoria

Quality Checks

  • [ ] Hipótesis es direccional (predice una dirección y magnitud específicas, no "veamos")
  • [ ] Métrica primaria es singular (métricas guardrail son secundarias)
  • [ ] Tamaño de muestra se calcula a partir del MDE y baseline real (no adivinado)
  • [ ] Duración del test cuenta para estacionalidad semanal (mínimo 2 semanas)
  • [ ] Métricas guardrail están definidas (al menos una para proteger revenue o engagement core)
  • [ ] Trigger de rollback está especificado con un threshold concreto

想直接用这个技能?

本站把开放许可(MIT / Apache 等)的技能按仓库打包整理到网盘,点一下转存到你自己的网盘,不用一个个从 GitHub 拉。许可未声明的技能只给原始仓库链接,不打包。

同名技能的其他版本

有 4 个不同仓库或目录里都有叫 ab-test-planner 的技能。它们内容并不相同,别混用: