A AWS publicou um guia mostrando como montar um pipeline de aumento de dados sintéticos para sistemas de segurança industrial. A ideia é treinar modelos que detectam pessoas perto de máquinas pesadas usando imagens foto-realistas geradas a partir de cenas reais, sem precisar registrar situações perigosas nem fazer anotação manual.

O processo usa o Qwen-Image-Edit-2509 no Amazon SageMaker AI para editar fotos que já mostram equipamentos, mas não pessoas. O modelo insere figuras humanas em posições relevantes para o risco, preservando luz, escala e contexto da cena original. Depois, o Amazon Rekognition identifica as pessoas inseridas e gera caixas delimitadoras automaticamente, que são usadas como rótulos de treino.
Nos testes descritos no post, a combinação com o detector YOLO11-nano trouxe até 160% de melhora no mAP50, de 0,051 para 0,134, quando foram usadas 750 imagens sintéticas. A AWS também observou que o posicionamento das pessoas é decisivo: colocá-las em áreas de risco dobrou o resultado, enquanto inseri-las ao fundo piorou a detecção.
A empresa diz que o método pode reduzir de semanas ou meses para horas o tempo para obter imagens rotuladas. Também afirma que um hardware mais forte, como instâncias com GPU H100, pode baixar o custo por imagem, mas essa projeção ainda não foi validada.