A Amazon Payments detalha como aplicou um bandit contextual multiobjetivo no Amazon SageMaker AI para personalizar o funil de aquisição de produtos. Em um teste A/B online de sete semanas, a equipe observou uma alta relativa de dígito único alto na conversão final do funil para uma população de clientes, enquanto outra não teve melhora em relação à experiência atual. Segundo a equipe, o limite estava no conteúdo, não no modelo.

O método escolhido foi o Linear UCB, que decide com base em sinais do visitante em vez de tratar todo o público como um bloco único. No sistema, cada cliente é representado por sinais comportamentais, como histórico de pagamento e mix de transações, e a decisão de qual variação mostrar muda conforme esse contexto.
Como o funil tem três etapas — início, submissão e aprovação —, a equipe rodou um modelo para cada uma e combinou as pontuações com pesos aproximadamente iguais. A ideia foi evitar que a melhora em uma etapa piorasse outra, já que aprovação depende de um sinal mais tardio que início ou submissão.
A publicação também mostra uma rotina semanal no SageMaker AI que lê os resultados no Amazon S3, atualiza o modelo e grava recomendações por cliente em um armazenamento de baixa latência. O modelo foi iniciado com um período de atribuição aleatória de conteúdo para reduzir viés de seleção, e a equipe disponibilizou um repositório para testes com dados sintéticos.