Pular para o conteúdo
← Todas as notícias

AWS detalha container Ray Serve para inferência e mostra migração a partir do TorchServe

O post apresenta o Ray Serve Deep Learning Container, imagem pré-testada para servir modelos com GPU, e mostra uma implantação do Qwen3-VL-2B no Amazon EKS com uma GPU.

A AWS detalha o Ray Serve Deep Learning Container (DLC), uma imagem pronta para inferência de modelos que reúne o ambiente de execução, as bibliotecas necessárias e o suporte a GPU já testados em conjunto. O texto é voltado a equipes que ainda usam o TorchServe, que deixou de receber manutenção ativa, sem novas correções de bugs, recursos ou patches de segurança planejados.

AWS detalha container Ray Serve para inferência e mostra migração a partir do TorchServe

Segundo a publicação, o problema do TorchServe vai além da falta de atualização: quem continua nele precisa manter a compatibilidade entre versões de PyTorch, CUDA e demais dependências, além de corrigir falhas em cada camada. O Ray Serve DLC tenta reduzir esse trabalho ao oferecer uma base única, mantida e validada pela AWS, com patches aplicados na construção da imagem.

O post também mostra como usar o contêiner para servir o modelo Qwen3-VL-2B em um cluster Amazon EKS com um único nó GPU, um g5.xlarge com uma GPU NVIDIA A10G e 24 GB de VRAM. O código da aplicação entra no contêiner por meio de um ConfigMap, o que permite alterar a lógica de atendimento sem reconstruir a imagem.

A AWS diz ainda que há imagens separadas para EKS, EC2 e SageMaker, e que modelos que precisam de bibliotecas extras podem ser adaptados sobre essa base. Para quem sai do TorchServe, o artigo destaca que não é preciso manter o handler personalizado nem o arquivo de configuração do serviço.

← Todas as notícias