Pular para o conteúdo
← Todas as notícias

SageMaker AI detalha 13 capacidades de inferência

Em um post de revisão, a Amazon descreve 13 capacidades de inferência adicionadas ao SageMaker AI em 2026, entre endpoints gerenciados e HyperPod Inference.

A Amazon SageMaker AI detalha 13 capacidades de inferência no acumulado de 2026, divididas entre endpoints gerenciados e o Amazon SageMaker HyperPod Inference. O post reúne as novidades e explica o que cada uma muda para quem executa modelos generativos em produção.

SageMaker AI detalha 13 capacidades de inferência

Nos endpoints gerenciados, a empresa mostra recomendações automatizadas de inferência, que ajudam a escolher tipo de instância, contêiner e ajustes de otimização a partir de um modelo e de uma meta de custo, latência ou volume. O texto diz que esse trabalho costuma levar de duas a três semanas de testes manuais. Também há fallback automático entre até cinco tipos de instância, para evitar interrupção quando falta capacidade no primeiro tipo escolhido.

A lista inclui ainda suporte a API compatível com OpenAI, o que permite trocar apenas a URL do endpoint em aplicações feitas com o SDK da OpenAI, LangChain ou Strands Agents. O post cita também cache de contêiner, que antecipa o download da imagem e, em um exemplo com Qwen3-8B no ml.g6.2xlarge, reduziu a inicialização de 525 segundos para 258 segundos. Outro ponto é a observabilidade, com mais de 100 métricas de inferência no CloudWatch, e a inferência assíncrona com envio direto do corpo da requisição em até 128.000 bytes, sem passar pelo S3.

No HyperPod Inference, a Amazon destaca um operador simplificado para implantar modelos com um único recurso, além de cache de KV em dois níveis e roteamento inteligente. Segundo o post, essa combinação reduz a latência em até 40% em tarefas de contexto longo e várias interações. Há também captura de dados de inferência para conformidade e análise offline.

← Todas as notícias