A AWS publicou um guia de implantação do WhisperX no Amazon SageMaker AI. O material mostra como usar o modelo em um Deep Learning Container já preparado para GPU, com Whisper, alinhamento forçado e diarização incluídos, sem precisar construir uma imagem própria.

O foco é gerar transcrições com timestamp por palavra e identificar quem falou em cada trecho. O texto explica que o WhisperX combina transcrição em lote com o Whisper, alinhamento com wav2vec2 e rotulagem de falantes, o que ajuda em tarefas como revisão de chamadas, legendas e análise de áudio.
O guia cobre dois tipos de endpoint. O real-time é indicado para trechos curtos e precisa terminar dentro do limite de 60 segundos do SageMaker AI. Para áudios longos, a publicação orienta usar o endpoint assíncrono, que envia a entrada e a saída por Amazon S3 e deixa o resultado disponível depois.
Entre os detalhes de produção, a AWS destaca um ajuste obrigatório nas variantes GPU: definir InferenceAmiVersion como al2-ami-sagemaker-inference-gpu-3-1. O texto também observa que a configuração usa um processo por contêiner, então a escala vem de mais instâncias, não de mais concorrência no mesmo servidor. O exemplo do guia usa uma gravação de cerca de 3 minutos das comunicações do voo US Airways 1549 para testar o sistema em fala com ruído e interrupções.