Pular para o conteúdo
← Todas as notícias

AWS mostra como implantar clonagem de voz em tempo real com Qwen3-TTS no SageMaker AI

Guia da AWS explica como colocar o Qwen3-TTS-12Hz-1.7B-Base em um endpoint gerenciado do SageMaker AI e usar um clipe curto para gerar fala na voz de referência.

A AWS publicou um guia para implantar o modelo público Qwen3-TTS-12Hz-1.7B-Base no Amazon SageMaker AI e usá-lo em um endpoint de inferência em tempo real. O foco é a clonagem de voz: com um trecho curto de áudio e a transcrição correspondente, o modelo gera novo texto na voz do locutor de referência, sem retreinar o sistema.

AWS mostra como implantar clonagem de voz em tempo real com Qwen3-TTS no SageMaker AI

O modelo é da família Qwen3-TTS, desenvolvida pela equipe Qwen da Alibaba Cloud, e cobre 10 idiomas: chinês, inglês, japonês, coreano, alemão, francês, russo, português, espanhol e italiano. O guia também mostra a clonagem entre idiomas, em que a voz capturada em um idioma é usada para gerar fala em outro, preservando a identidade vocal.

A implantação é feita pelo SageMaker JumpStart, que fornece os artefatos do modelo e um contêiner pronto para uso. O post orienta a criação do endpoint com o SDK do SageMaker e destaca um ajuste importante: a fração de memória GPU deve ser configurada em 0,45 para cada um dos dois estágios do modelo, que compartilham a mesma GPU. O texto diz que uma GPU de 24 GB, como a da família g6 com NVIDIA L4, se encaixa bem nesse modelo de 1,7 bilhão de parâmetros.

Para testar, o áudio de referência deve ser enviado como uma URI base64 em WAV mono de 24 kHz, junto com o texto que será falado. O guia ainda lembra que, para textos longos, é melhor dividir a entrada em trechos menores para manter a voz consistente. Ao final, a AWS também mostra como acompanhar o endpoint no CloudWatch e como excluir os recursos depois do uso.

← Todas as notícias