Estado de la evidencia: Estudio de caso publicado por la agencia con pruebas 50/50 repetidas; el apéndice estadístico detallado no es público

La parte más fuerte del caso de RAC es el escepticismo

Muchos estudios de caso de automatización comienzan con la suposición de que el sistema más nuevo es mejor.

La historia de búsqueda paga de RAC comienza de forma diferente.

Según Merkle, la organización de asistencia en carretera del Reino Unido ya había probado pujas en el momento de la subasta en 2021 y 2022 y descubrió que su enfoque existente de pujas intradía con CPC manual tuvo un mejor rendimiento.

Ese historial importa.

RAC no tenía una objeción teórica a la automatización. Tenía evidencia interna que respaldaba el método vigente.

El desafío, por lo tanto, no era “¿Cómo implementamos pujas basadas en valor?”

Era:

¿La tecnología mejoró lo suficiente como para que la antigua conclusión deba probarse de nuevo?

Esa es una pregunta operativa mucho más fuerte.

El método vigente se había ganado el derecho de ser la línea base

Los equipos con frecuencia tratan la lógica de campañas heredadas como deuda técnica por defecto.

A veces, lo es.

A veces, refleja un sistema que fue probado y funcionó.

Merkle afirma que RAC usó pujas intradía junto con CPC manual para impulsar los ingresos de ventas online y tenía pruebas anteriores que respaldaban el enfoque.

Sustituir ese sistema sin una comparación controlada habría mezclado la adopción de tecnología con la estrategia.

En cambio, el equipo usó el método vigente como línea base.

Este es un principio útil:

La automatización debe competir con el mejor proceso actual, no con una cuenta manual usada como hombre de paja.

Eso hace que el resultado sea más significativo.

El tratamiento combinó señales de momento de la subasta y de valor

La prueba no evaluó “automatización” en abstracto.

RAC combinó:

  • pujas en el momento de la subasta;
  • pujas basadas en valor;
  • tROAS;
  • valores de conversión de Floodlight;
  • pruebas estructuradas mediante Search Ads 360.

Las principales medidas de éxito incluyeron ingresos promedio por usuario y ROAS, con la tasa de conversión y el tráfico de alta intención también monitoreados.

Merkle afirma que el equipo implementó varias pruebas 50/50 en campañas de alto volumen.

Esa frase es importante.

Las pruebas repetidas en varias campañas son evidencia operativa más fuerte que una única comparación antes y después.

Una prueba antes y después puede contaminarse por estacionalidad, promociones, cambios de competidores o cambios en la demanda.

Un diseño simultáneo 50/50 reduce algunos de esos riesgos.

Los resultados reportados

Merkle informa que las campañas que usaban tROAS con pujas en el momento de la subasta y valores de Floodlight superaron a las alternativas.

La agencia enumera los siguientes resultados:

  • aumento del 27% en los ingresos
  • aumento del 30% en la tasa de conversión
  • aumento del 4% en el ARPU
  • aumento del 14% en el ROAS

El caso también afirma que la ventaja se mantuvo durante períodos críticos de ventas y períodos comerciales habituales.

Con base en esos resultados, RAC adoptó pujas basadas en valor en el momento de la subasta como estándar para campañas de búsqueda paga enfocadas en el rendimiento.

Esos números son significativos.

El caso público no divulga el número exacto de campañas, la duración de la prueba para cada división, la inversión en medios, la significancia estadística ni las tablas brutas de tratamiento/control.

Por lo tanto, deben tratarse como resultados reportados por la agencia de un programa de pruebas estructurado, y no como un experimento académico totalmente reproducible.

El hecho de que los ingresos y el ROAS se muevan juntos importa

Un fallo común de la automatización es mejorar la eficiencia reduciendo la escala.

Si un sistema de pujas recorta el gasto de forma agresiva, el ROAS puede aumentar mientras los ingresos caen.

Eso puede ser racional cuando el gasto anterior no era rentable.

No es automáticamente una mejora de rendimiento.

El resultado de RAC es más interesante porque Merkle informa mayores ingresos y mayor ROAS al mismo tiempo.

Si es exacto, esto sugiere que el tratamiento encontró una mejor asignación del gasto, en lugar de simplemente reducir la exposición.

El aumento del 30% en la tasa de conversión y el aumento del 4% en el ARPU también apuntan a un efecto de mix: el sistema puede haber encontrado usuarios o subastas con mayor probabilidad de conversión y mayor valor esperado.

Es exactamente para lo que se diseñaron las pujas basadas en valor.

Los valores de Floodlight no eran un detalle de reporte

Las pujas basadas en valor exigen una señal de valor.

Si toda conversión se trata como igual, el sistema puede optimizar el volumen de conversiones, pero no puede distinguir un resultado de alto valor de uno de bajo valor.

Merkle afirma que los valores de conversión de Floodlight estaban alineados con los objetivos de negocio de RAC.

Esa es la dependencia oculta en el caso.

El algoritmo de pujas puede ser sofisticado.

Su objetivo es tan útil como el modelo de valor que se le proporciona.

Por eso los equipos no deben copiar la configuración de pujas de RAC antes de preguntar:

  • ¿Qué significa económicamente una conversión?
  • ¿Los valores son estáticos o dinámicos?
  • ¿Los valores reflejan ingresos, margen o calidad del cliente?
  • ¿Faltan resultados posteriores importantes?
  • ¿Con qué rapidez están disponibles esos valores?
  • ¿Son lo suficientemente confiables para orientar decisiones en el momento de la subasta?

La parte más transferible del caso puede ser el diseño de la señal, y no la etiqueta de las pujas.

Por qué un fallo anterior debe aumentar la calidad de la prueba, y no bloquear nuevas pruebas

Las organizaciones con frecuencia desarrollan memoria institucional en torno a la automatización.

“Probamos concordancia amplia y salió mal.”

“Smart Bidding no funcionó para nosotros.”

“PMax falló el año pasado.”

Esas afirmaciones pueden seguir siendo ciertas para la prueba original y volverse obsoletas.

Las plataformas cambian.

La arquitectura de conversión cambia.

Los creativos mejoran.

El negocio cambia.

Una prueba fallida debe crear un umbral de repetición de pruebas, y no una doctrina permanente.

Para RAC, Merkle afirma que pruebas internas anteriores respaldaban las pujas intradía. La empresa después optó por reevaluar las pujas en el momento de la subasta porque la tecnología había avanzado.

Esa es una respuesta madura.

Los extremos alternativos son ambos más débiles:

  • adoptar cada nuevo recurso porque la plataforma lo promueve;
  • negarse a volver a probar porque una versión anterior falló.

Modo de fallo: cambiar la cuenta entera antes de probar el tratamiento

Los cambios de automatización pueden tener grandes efectos de portafolio.

Si RAC hubiera migrado todas las campañas de rendimiento al nuevo método de una sola vez, el equipo habría perdido su línea base.

Cualquier mejora o deterioro posterior sería difícil de atribuir.

La estructura 50/50 preservó un contrafactual.

Para otros equipos, la lección práctica es crear una vía de migración.

Seleccione campañas que sean:

  • suficientemente grandes para generar evidencia;
  • lo suficientemente representativas como para importar;
  • operativamente seguras como para probar;
  • medibles con un KPI de negocio estable.

Después, expanda solo si el tratamiento justifica la implementación.

Modo de fallo: medir solo el CPA

Suponga que el nuevo sistema hubiera aumentado el volumen de conversiones en un 30% mientras empujaba a los usuarios hacia productos de menor valor.

El CPA podría parecer excelente.

El negocio aún podría perder valor.

El uso de ARPU, ingresos y ROAS por parte de RAC junto con la tasa de conversión es, por lo tanto, importante.

Los sistemas basados en valor deben evaluarse con resultados basados en valor.

La métrica exacta depende del negocio:

  • ingresos por conversión;
  • margen de contribución;
  • LTV esperado;
  • valor de la póliza;
  • valor de oportunidad calificada;
  • beneficio por reserva.

Si la métrica de evaluación no refleja la señal de valor que el sistema está optimizando, el equipo no puede decir si la automatización mejoró el objetivo previsto.

Modo de fallo: dejar que la automatización elimine la estrategia de promociones

RAC opera en un negocio en el que los períodos promocionales importan.

Esto crea una preocupación clásica: ¿un sistema automatizado puede reaccionar adecuadamente durante una demanda inusual?

Merkle afirma que el tratamiento siguió teniendo buen rendimiento durante eventos críticos de ventas, así como en períodos habituales.

Esa es una evidencia útil porque muchos equipos desconfían de las pujas automatizadas justamente cuando las condiciones comerciales se vuelven anormales.

La respuesta operativa correcta no es suponer que el algoritmo se hará cargo de todas las promociones.

Es incluir períodos promocionales en el programa de pruebas.

Si al negocio le importan la Black Friday, la temporada de renovaciones, los lanzamientos de productos o la demanda de días festivos, el sistema de pujas debe ganarse la confianza en esas condiciones antes de convertirse en el estándar.

Lo que el caso no prueba

El resultado de RAC no prueba:

  • que las pujas en el momento de la subasta siempre superan a las pujas manuales;
  • que las pujas basadas en valor funcionan sin valores de conversión precisos;
  • que el tROAS es la estrategia correcta para todas las campañas;
  • que un crecimiento del 14% en el ROAS es un benchmark razonable;
  • que las pruebas de automatización que fallaron anteriormente deben ignorarse;
  • que Search Ads 360 es necesario para aplicar el método general.

La conclusión más fuerte es más restringida:

RAC usó comparaciones controladas repetidas para determinar que un enfoque de pujas automatizadas más nuevo se había vuelto más eficaz que su proceso establecido en las condiciones probadas.

Esa es una disciplina de probar e implementar.

Una estructura de implementación transferible

Los equipos pueden copiar el proceso sin copiar las configuraciones.

1. Defina el método vigente. Documente el método actual y por qué existe.

2. Mejore la señal de valor. Asegúrese de que el tratamiento optimice algo económicamente significativo.

3. Elija campañas representativas. Evite campañas minúsculas que no pueden producir evidencia útil.

4. Ejecute pruebas simultáneas. Preserve una línea base válida.

5. Mida el valor, no solo el conteo de conversiones.

6. Incluya períodos anormales cuando sea relevante.

7. Implemente solo después de que el tratamiento supere repetidamente al método vigente.

8. Continúe monitoreando después de la migración.

El resultado no es fe ciega en la automatización.

Es una razón basada en evidencia para confiar más en ella.

Nota de evidencia

Este artículo se basa principalmente en un estudio de caso publicado por Merkle, la agencia involucrada en la implementación. La página describe varias pruebas 50/50 e informa los resultados principales, pero no publica el conjunto completo de datos subyacentes ni el apéndice estadístico. Radar, por lo tanto, trata las cifras de 27% de ingresos, 30% de tasa de conversión, 4% de ARPU y 14% de ROAS como resultados reportados por la agencia de un programa de pruebas estructurado.

Sigue en Radar