Pular para o conteúdo
← Todas as notícias

AWS detalha tutorial para streaming de fala com vLLM-Omni no SageMaker AI

O guia mostra como implantar o modelo Qwen3-TTS no SageMaker AI com o container vLLM-Omni e enviar áudio em partes pela mesma conexão usada para o texto.

A AWS publicou um tutorial que mostra como implantar um modelo de texto para fala no Amazon SageMaker AI para começar a tocar o áudio antes de a resposta completa ficar pronta. O exemplo usa o AWS vLLM-Omni Deep Learning Container para executar o Qwen3-TTS e testar o fluxo em uma aplicação Gradio.

AWS detalha tutorial para streaming de fala com vLLM-Omni no SageMaker AI

O ponto central é a conexão bidirecional persistente: o cliente envia texto e recebe áudio pela mesma ligação, sem separar a ida e a volta da conversa em etapas diferentes. No material, o áudio sai em trechos de PCM a 24 kHz, e o serviço usa a rota nativa v1/audio/speech/stream do vLLM-Omni.

A AWS também posiciona o vLLM-Omni como uma extensão do vLLM que atende modelos de texto, áudio, imagem e vídeo. No caso deste tutorial, porém, o foco é só a fala sintetizada, como complemento a um post anterior da empresa sobre transcrição de áudio do microfone para texto.

O exemplo vem com código em um repositório público, incluindo o script de implantação e o cliente Gradio para testar a interação. A AWS lembra ainda que, depois do teste, é preciso apagar os recursos para evitar custos com a instância GPU.

← Todas as notícias