A AWS publicou um guia para implantar o modelo público Qwen3-TTS-12Hz-1.7B-Base no Amazon SageMaker AI e usá-lo em um endpoint de inferência em tempo real. O foco é a clonagem de voz: com um trecho curto de áudio e a transcrição correspondente, o modelo gera novo texto na voz do locutor de referência, sem retreinar o sistema.

O modelo é da família Qwen3-TTS, desenvolvida pela equipe Qwen da Alibaba Cloud, e cobre 10 idiomas: chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano. O guia também mostra a clonagem entre idiomas, em que a voz capturada em um idioma é usada para gerar fala em outro, preservando a identidade vocal.
A implantação é feita pelo SageMaker JumpStart, que fornece os artefatos do modelo e um contêiner pronto para uso. O post orienta a criação do endpoint com o SDK do SageMaker e destaca um ajuste importante: a fração de memória GPU deve ser configurada em 0,45 para cada um dos dois estágios do modelo, que compartilham a mesma GPU. O texto diz que uma GPU de 24 GB, como a da família g6 com NVIDIA L4, se encaixa bem nesse modelo de 1,7 bilhão de parâmetros.
Para testar, o áudio de referência deve ser enviado como uma URI base64 em WAV mono de 24 kHz, junto com o texto que será falado. O guia ainda lembra que, para textos longos, é melhor dividir a entrada em trechos menores para manter a voz consistente. Ao final, a AWS também mostra como acompanhar o endpoint no CloudWatch e como excluir os recursos depois do uso.