A AWS publicou um guia que mostra como gerar uma imagem a partir de texto e, em seguida, animá-la em um vídeo curto no Amazon SageMaker AI. O fluxo usa dois endpoints criados a partir do mesmo AWS vLLM-Omni Deep Learning Container (DLC): um em tempo real para FLUX.2-klein-4B e outro assíncrono para Wan2.1-VACE-1.3B.

No processo, o prompt de texto vira uma imagem estática. Depois, essa imagem é enviada junto com um prompt de movimento ao endpoint de vídeo, que devolve o MP4 no Amazon S3. O material também inclui um fluxo por linha de comando e uma interface opcional em Streamlit.
O guia destaca que o mesmo container é reaproveitado nos dois endpoints, mudando apenas a variável SM_VLLM_MODEL para carregar cada modelo. A diferença entre os modos de inferência não é tratada como regra geral, mas como escolha do exemplo: a imagem retorna diretamente, enquanto o vídeo usa fila assíncrona porque leva mais tempo e depende de uma solicitação em formato multiparte.
Há ainda um aviso prático: as configurações padrão do vídeo usam 17 quadros e 30 passos de difusão. A AWS diz que quatro passos servem só para um teste rápido, pois não preservam a composição original. O texto também lembra que, ao final, é preciso excluir endpoints e modelos para evitar cobranças contínuas por GPU.