Tests A/B en el lobby del casino sin engañarte
Retention · 2026-07-19 · 9 min read · By CROCO Games
Los experimentos de lobby fallan de formas predecibles: demasiado pequeños, contaminados o medidos sobre el número equivocado. Un método de trabajo para probar colocación, tiles y filas.
Los tests de lobby de casino tienen un historial inusualmente malo, y no porque los equipos que los ejecutan sean descuidados. El entorno es genuinamente hostil a los experimentos limpios: el tráfico se distribuye de forma desigual entre mercados y dispositivos, la variable de resultado tiene colas pesadas hasta el extremo, los jugadores cambian de segmento durante el test y lo que cambiaste es visible para todos a la vez. La mayoría de las "victorias" de lobby publicadas no sobreviviría a una segunda ejecución.
Este es un método de trabajo: qué probar, cómo dimensionarlo, las cuatro formas en que se contamina el resultado y qué hacer cuando la respuesta es "sin diferencia".
Prueba lo que de verdad es testeable
Los buenos experimentos de lobby comparten una propiedad: cambia un elemento visible y todo lo demás queda fijo. Eso descarta la mayor parte de lo que los equipos quieren probar primero ("nuestro nuevo lobby") y apunta a una lista corta que funciona:
- Cambios de miniatura en una posición fija — el test más limpio de la casa, porque juego, matemática y colocación permanecen constantes. Ver la capa de los tres segundos.
- Posición dentro de una estantería — el mismo título en el hueco 2 frente al hueco 7.
- Orden de filas — mover una fila temática por encima o por debajo de la línea de flotación.
- Composición de filas — filas específicas por segmento frente a una fila genérica de Populares.
- Presencia de badge — el mismo título con y sin la etiqueta "Hot".
Lo que no funciona como test A/B: los rediseños completos del lobby (demasiados cambios simultáneos para atribuir nada) y cualquier cosa donde el grupo de control pueda ver el tratamiento.
Dimensionar: el número que mata la mayoría de los tests
Los datos de resultados de casino tienen colas pesadas. Un puñado de jugadores aporta una parte desproporcionada de la facturación, lo que significa que las métricas monetarias tienen una varianza enorme y exigen tamaños muestrales que la mayoría de los operadores no puede alcanzar para un test de una sola posición en una ventana razonable.
La respuesta práctica es elegir una métrica de resultado con menor varianza y aceptar que es un proxy:
| Métrica | Varianza | Muestra necesaria | Úsala cuando |
|---|---|---|---|
| Click-through del tile | Baja | Miles de impresiones | Pruebas de miniaturas, badges, posición |
| Partidas iniciadas por sesión expuesta | Baja-media | Decenas de miles de sesiones | Pruebas de filas y colocación |
| Rondas por sesión expuesta | Media | Decenas de miles | Probar si el interés se convierte en juego |
| Ingreso neto por jugador expuesto | Muy alta | Normalmente inalcanzable | Solo evaluación del programa a largo plazo |
El encuadre honesto: usa el click-through y las partidas iniciadas para decidir cuestiones de merchandising, y reserva el ingreso como métrica guardarraíl que revisas para detectar catástrofes, no como lo que optimizas. Si un test muestra una subida de ingresos del 3% con 5.000 jugadores, has medido ruido.
Decide la métrica, el efecto mínimo por el que merece la pena actuar y la fecha de parada antes de que empiece el test, y déjalos por escrito. Espiar una métrica de colas pesadas en marcha y parar cuando pinta bien es la manera en que las organizaciones acumulan una cartera de victorias imaginarias.
Las cuatro contaminaciones
1. Novedad. Cualquier cambio visible produce un pico de atención de corta vida. Los habituales notan que algo se movió, hacen clic y vuelven a lo suyo. Un test que dura tres días mide novedad; ejecuta al menos dos ciclos semanales completos para que el comportamiento de entre semana y el de fin de semana estén representados, e inspecciona si el efecto decae a lo largo de la ventana.
2. Canibalización. Promocionar el título A empuja hacia abajo al título B. Medir solo A muestra una victoria limpia mientras el lobby no ganó nada. Define siempre el resultado a nivel de fila o de lobby, no de título: partidas totales iniciadas desde la estantería, no partidas del juego promocionado.
3. Selección. Si la asignación es por mercado, dispositivo o sesión en lugar de por jugador, los grupos difieren sistemáticamente antes de que empiece el test. Aleatoriza a nivel de jugador donde la plataforma lo permita, y comprueba siempre el equilibrio del periodo previo en la métrica de resultado — si los grupos ya diferían antes del cambio, la diferencia posterior no significa nada.
4. Fugas. Los jugadores usan varios dispositivos, comparten cuentas y leen webs de afiliados y streams que empujan los mismos títulos. Las fugas sesgan los resultados hacia cero, lo que hace más difícil detectar efectos reales y — peor — lleva a los equipos a concluir que el merchandising no importa cuando el test simplemente no podía verlo.
El factor de confusión que esta industria no puede ignorar: la exposición engendra exposición
Hay una razón estructural por la que los tests de lobby engañan más que los de otras industrias. La posición impulsa el juego, y el juego produce después los números que justifican la posición — un bucle que se sella a sí mismo, y que también opera durante tu experimento. Si las estanterías de tu plataforma se ordenan dinámicamente por facturación reciente, un título subido a un hueco mejor sigue escalando por el empujón. No estás midiendo la preferencia del jugador; estás midiendo tu propio algoritmo de ranking.
Antes de ejecutar cualquier test de colocación, averigua si la estantería sobre la que pruebas está curada a mano o rankeada algorítmicamente, y congela el ranking mientras dure el test si es lo segundo. Combinado con el hallazgo de que la mitad de un top ten sigue igual seis semanas después, esto también explica por qué los tests de colocación necesitan programación explícita: las estanterías no producen de forma natural variación que observar, así que tienes que crearla deliberadamente.
Qué aporta la investigación — y dónde se detiene
El trabajo de laboratorio es genuinamente útil para generar hipótesis sobre por qué funciona un cambio de lobby. El estudio de Graydon de 2018, que muestra que las señales previas al juego desplazan la selección de juego con independencia del retorno, te dice que las miniaturas y los badges merecen probarse siquiera. Pero un efecto de laboratorio con 33 participantes eligiendo entre cuatro máquinas no predice el tamaño del efecto en tu tráfico — predice la dirección que merece investigarse. Trata la psicología publicada como generadora de hipótesis, y tu propio holdout como la evidencia.
Cuando la respuesta es "sin diferencia"
La mayoría de los tests de lobby no devuelve ningún efecto detectable, y este es el resultado que los equipos gestionan peor — normalmente troceando los datos hasta que algún subgrupo muestra algo. Tres respuestas mejores:
Primera, comprueba si el test podía detectar el efecto que te importaba. Si tu efecto mínimo de interés era del 2% y el diseño solo podía detectar un 10%, el resultado es "no medimos", no "sin diferencia".
Segunda, trata los resultados nulos genuinos como licencia para decidir por otros motivos — coste, términos contractuales, equilibrio de cartera. Saber que la posición 4 y la posición 7 rinden igual para un título es un hallazgo útil y accionable.
Tercera, conserva el registro. Un archivo de tests ejecutados, efectos medidos y decisiones tomadas es lo que evita que un equipo nuevo repita el mismo experimento cada dieciocho meses, y es el único activo duradero que produce un programa de experimentación.
Preguntas frecuentes
¿Qué se puede probar con un test A/B en el lobby de un casino?
Elementos visibles individuales con todo lo demás fijo: cambios de miniatura en una posición determinada, la posición de un título dentro de una estantería, el orden de las filas, la composición de las filas y la presencia de badges. Los rediseños completos del lobby no pueden atribuirse y no son tests A/B.
¿Cuánto debe durar un test de lobby de casino?
Al menos dos ciclos semanales completos, para capturar tanto el comportamiento de entre semana como el de fin de semana, con la fecha de parada fijada de antemano. Las ventanas más cortas miden sobre todo el pico de novedad que sigue a cualquier cambio visible.
¿Por qué los tests de lobby tan a menudo no muestran resultado?
Normalmente porque la métrica de resultado tenía colas demasiado pesadas para la muestra — el ingreso por jugador necesita mucho más tráfico del que aporta un test de una sola posición — o porque las fugas y la canibalización sesgaron la estimación hacia cero. Usa el click-through o las partidas iniciadas como métrica de decisión.
¿Debería ser el ingreso la métrica de éxito de un experimento de lobby?
Rara vez. El ingreso por jugador expuesto tiene una varianza tan alta que los tamaños muestrales realistas no pueden detectar efectos plausibles. Úsalo como guardarraíl para detectar daños, y decide con métricas de engagement de menor varianza.
Conclusiones clave
- Prueba solo cambios visibles individuales con todo lo demás constante; los cambios de miniatura en posición fija son el experimento de lobby más limpio disponible.
- Elige una métrica de decisión de baja varianza — click-through o partidas iniciadas — y trata el ingreso como guardarraíl, no como objetivo.
- Protégete de la novedad, la canibalización, la selección y las fugas; mide a nivel de fila para detectar juegos que se roban entre sí.
- Congela el ranking algorítmico de la estantería durante los tests de colocación, o medirás tu propio bucle de ranking en lugar del comportamiento del jugador.
- Preregistra métrica, efecto mínimo y fecha de parada; mantén un registro de tests para que los resultados nulos se recuerden en lugar de repetirse.
Colabora con CROCO Games
Ejecutar un test justo requiere un proveedor que haga visibles las variables. CROCO entrega especificaciones por título y múltiples formatos de arte de lobby, de modo que un test de miniatura o de colocación cambia exactamente una cosa — y el soporte de rondas gratis te permite ejecutar tests de exposición con un título aspirante sin reconstruir tu stack promocional.
La integración es una única API REST, en vivo en unas 24 horas, que ya sirve a 600+ operadores en 50+ mercados; los benchmarks publicados de la cartera (13,78% en día 2, 26,89% en día 7) te dan un prior contra el que contrastar, en lugar de una hoja en blanco. Tráenos una posición que quieras desafiar y te ayudaremos a diseñar el test a su alrededor.