Status das evidências: Estudo de caso publicado pela agência com testes 50/50 repetidos; apêndice estatístico detalhado não é público
A parte mais forte do caso da RAC é o ceticismo
Muitos estudos de caso de automação começam com a suposição de que o sistema mais novo é melhor.
A história de pesquisa paga da RAC começa de forma diferente.
Segundo a Merkle, a organização de assistência rodoviária do Reino Unido já tinha testado lances no momento do leilão em 2021 e 2022 e descobriu que sua abordagem existente de lances intradiários com CPC manual teve melhor desempenho.
Esse histórico importa.
A RAC não tinha uma objeção teórica à automação. Tinha evidências internas que apoiavam o método vigente.
O desafio, portanto, não era “Como implementamos lances baseados em valor?”
Era:
A tecnologia melhorou o suficiente para que a antiga conclusão deva ser testada novamente?
Essa é uma pergunta operacional muito mais forte.
O método vigente tinha conquistado o direito de ser a linha de base
As equipes frequentemente tratam a lógica de campanhas legadas como dívida técnica por padrão.
Às vezes, é mesmo.
Às vezes, reflete um sistema que foi testado e funcionou.
A Merkle afirma que a RAC usou lances intradiários junto com CPC manual para impulsionar a receita de vendas online e tinha testes anteriores que apoiavam a abordagem.
Substituir esse sistema sem uma comparação controlada teria misturado adoção de tecnologia com estratégia.
Em vez disso, a equipe usou o método vigente como linha de base.
Este é um princípio útil:
A automação deve competir com o melhor processo atual, não com uma conta manual usada como espantalho.
Isso torna o resultado mais significativo.
O tratamento combinou sinais de momento do leilão e de valor
O teste não avaliou “automação” no abstrato.
A RAC combinou:
- lances no momento do leilão;
- lances baseados em valor;
- tROAS;
- valores de conversão do Floodlight;
- testes estruturados por meio do Search Ads 360.
As principais medidas de sucesso incluíram receita média por usuário e ROAS, com taxa de conversão e tráfego de alta intenção também monitorados.
A Merkle afirma que a equipe implantou vários testes 50/50 em campanhas de alto volume.
Essa frase é importante.
Testes repetidos em várias campanhas são evidências operacionais mais fortes do que uma única comparação antes e depois.
Um teste antes e depois pode ser contaminado por sazonalidade, promoções, mudanças de concorrentes ou mudanças na demanda.
Um desenho simultâneo 50/50 reduz alguns desses riscos.
Os resultados relatados
A Merkle relata que campanhas que usavam tROAS com lances no momento do leilão e valores do Floodlight superaram as alternativas.
A agência lista os seguintes resultados:
- aumento de 27% na receita
- aumento de 30% na taxa de conversão
- aumento de 4% no ARPU
- aumento de 14% no ROAS
O caso também afirma que a vantagem se manteve durante períodos críticos de vendas e períodos comerciais comuns.
Com base nesses resultados, a RAC adotou lances baseados em valor no momento do leilão como padrão para campanhas de pesquisa paga focadas em desempenho.
Esses números são significativos.
O caso público não divulga o número exato de campanhas, a duração do teste para cada divisão, o investimento em mídia, a significância estatística ou as tabelas brutas de tratamento/controle.
Eles devem, portanto, ser tratados como resultados relatados pela agência de um programa de testes estruturado, e não como um experimento acadêmico totalmente reproduzível.
O fato de receita e ROAS se moverem juntos importa
Uma falha comum da automação é melhorar a eficiência reduzindo a escala.
Se um sistema de lances corta gastos de forma agressiva, o ROAS pode aumentar enquanto a receita cai.
Isso pode ser racional quando o gasto anterior não era lucrativo.
Não é automaticamente uma melhoria de desempenho.
O resultado da RAC é mais interessante porque a Merkle relata receita maior e ROAS maior ao mesmo tempo.
Se preciso, isso sugere que o tratamento encontrou uma alocação melhor de gastos, em vez de simplesmente reduzir a exposição.
O aumento de 30% na taxa de conversão e o aumento de 4% no ARPU também apontam para um efeito de mix: o sistema pode ter encontrado usuários ou leilões com maior probabilidade de conversão e maior valor esperado.
É exatamente para isso que os lances baseados em valor foram projetados.
Os valores do Floodlight não eram um detalhe de relatório
Lances baseados em valor exigem um sinal de valor.
Se toda conversão for tratada como igual, o sistema pode otimizar o volume de conversões, mas não consegue distinguir um resultado de alto valor de um de baixo valor.
A Merkle afirma que os valores de conversão do Floodlight estavam alinhados aos objetivos de negócio da RAC.
Essa é a dependência oculta no caso.
O algoritmo de lances pode ser sofisticado.
Seu objetivo é tão útil quanto o modelo de valor fornecido a ele.
É por isso que as equipes não devem copiar a configuração de lances da RAC antes de perguntar:
- O que uma conversão significa economicamente?
- Os valores são estáticos ou dinâmicos?
- Os valores refletem receita, margem ou qualidade do cliente?
- Faltam resultados posteriores importantes?
- Com que rapidez esses valores ficam disponíveis?
- Eles são confiáveis o suficiente para orientar decisões no momento do leilão?
A parte mais transferível do caso pode ser o desenho do sinal, e não o rótulo dos lances.
Por que uma falha anterior deve aumentar a qualidade do teste, e não bloquear novos testes
As organizações frequentemente desenvolvem memória institucional em torno da automação.
“Testamos correspondência ampla e foi ruim.”
“O Smart Bidding não funcionou para nós.”
“O PMax falhou no ano passado.”
Essas afirmações podem continuar verdadeiras para o teste original e se tornar obsoletas.
As plataformas mudam.
A arquitetura de conversão muda.
Os criativos melhoram.
O negócio muda.
Um teste malsucedido deve criar um limiar de reteste, e não uma doutrina permanente.
Para a RAC, a Merkle afirma que testes internos anteriores apoiavam os lances intradiários. A empresa depois optou por reavaliar os lances no momento do leilão porque a tecnologia havia avançado.
Essa é uma resposta madura.
Os extremos alternativos são ambos mais fracos:
- adotar cada novo recurso porque a plataforma o promove;
- recusar-se a retestar porque uma versão anterior falhou.
Modo de falha: trocar a conta inteira antes de provar o tratamento
Mudanças de automação podem ter grandes efeitos de portfólio.
Se a RAC tivesse migrado todas as campanhas de desempenho para o novo método de uma só vez, a equipe teria perdido sua linha de base.
Qualquer melhoria ou deterioração subsequente seria difícil de atribuir.
A estrutura 50/50 preservou um contrafactual.
Para outras equipes, a lição prática é criar uma via de migração.
Selecione campanhas que sejam:
- grandes o suficiente para gerar evidências;
- representativas o suficiente para importar;
- operacionalmente seguras o suficiente para testar;
- mensuráveis com um KPI de negócio estável.
Depois, expanda somente se o tratamento justificar a implementação.
Modo de falha: medir apenas o CPA
Suponha que o novo sistema tivesse aumentado o volume de conversões em 30% enquanto empurrava usuários para produtos de menor valor.
O CPA poderia parecer excelente.
O negócio ainda poderia perder valor.
O uso de ARPU, receita e ROAS pela RAC junto com a taxa de conversão é, portanto, importante.
Sistemas baseados em valor devem ser avaliados com resultados baseados em valor.
A métrica exata depende do negócio:
- receita por conversão;
- margem de contribuição;
- LTV esperado;
- valor da apólice;
- valor de oportunidade qualificada;
- lucro por reserva.
Se a métrica de avaliação não reflete o sinal de valor que o sistema está otimizando, a equipe não consegue dizer se a automação melhorou o objetivo pretendido.
Modo de falha: deixar a automação apagar a estratégia de promoções
A RAC atua em um negócio no qual os períodos promocionais importam.
Isso cria uma preocupação clássica: um sistema automatizado consegue reagir adequadamente durante demanda incomum?
A Merkle afirma que o tratamento continuou a ter desempenho durante eventos críticos de vendas, bem como em períodos comuns.
Essa é uma evidência útil porque muitas equipes desconfiam de lances automatizados justamente quando as condições comerciais se tornam anormais.
A resposta operacional correta não é presumir que o algoritmo dará conta de todas as promoções.
É incluir períodos promocionais no programa de testes.
Se o negócio se importa com a Black Friday, temporada de renovações, lançamentos de produtos ou demanda de feriados, o sistema de lances deve conquistar confiança nessas condições antes de se tornar o padrão.
O que o caso não prova
O resultado da RAC não prova:
- que os lances no momento do leilão sempre superam os lances manuais;
- que os lances baseados em valor funcionam sem valores de conversão precisos;
- que o tROAS é a estratégia correta para todas as campanhas;
- que um crescimento de 14% no ROAS é um benchmark razoável;
- que testes de automação que falharam anteriormente devem ser ignorados;
- que o Search Ads 360 é necessário para aplicar o método geral.
A conclusão mais forte é mais restrita:
A RAC usou comparações controladas repetidas para determinar que uma abordagem de lances automatizados mais nova havia se tornado mais eficaz do que seu processo estabelecido nas condições testadas.
Essa é uma disciplina de testar e implantar.
Uma estrutura de implementação transferível
As equipes podem copiar o processo sem copiar as configurações.
1. Defina o método vigente. Documente o método atual e por que ele existe.
2. Melhore o sinal de valor. Certifique-se de que o tratamento otimize algo economicamente significativo.
3. Escolha campanhas representativas. Evite campanhas minúsculas que não podem produzir evidências úteis.
4. Execute testes simultâneos. Preserve uma linha de base válida.
5. Meça valor, não apenas a contagem de conversões.
6. Inclua períodos anormais quando relevante.
7. Implemente somente depois que o tratamento superar o método vigente repetidamente.
8. Continue monitorando após a migração.
O resultado não é fé cega na automação.
É uma razão baseada em evidências para confiar mais nela.
Nota de evidências
Este artigo se baseia principalmente em um estudo de caso publicado pela Merkle, a agência envolvida na implementação. A página descreve vários testes 50/50 e relata os resultados principais, mas não publica o conjunto completo de dados subjacentes nem o apêndice estatístico. O Radar, portanto, trata os números de 27% de receita, 30% de taxa de conversão, 4% de ARPU e 14% de ROAS como resultados relatados pela agência de um programa de testes estruturado.



