A AWS detalha o Amazon SageMaker HyperPod Inference Gateway, um add-on nativo do Kubernetes para Amazon EKS que encaminha cada requisição de inferência ao pod mais adequado com base em sinais de GPU em tempo real. A empresa diz que isso pode reduzir a latência do primeiro token em até 82%, sem mudanças nos servidores de modelo nem nas aplicações cliente.

A ferramenta foi apresentada como um componente de dois níveis. No primeiro, instalado em cada cluster HyperPod/EKS, há um proxy HTTPS, um roteador que lê o campo de modelo no corpo da requisição e um seletor que usa métricas do Prometheus para escolher o pod com melhor condição. Isso permite rotear uma única camada para vários modelos e também tratar pedidos de adaptação LoRA, preferindo pods que já tenham o adaptador carregado na memória.
A AWS também comparou o gateway com o roteamento round-robin padrão em quatro modelos, de 8B a 235B parâmetros, em instâncias p5.48xlarge (H100) e g5 (A10G). Nos testes, a empresa afirma que o ganho aparece sobretudo em frotas mistas, tráfego em rajadas e cenários com prefixos compartilhados; em um conjunto uniforme e com tráfego estável, o resultado ficou equivalente ao round-robin dentro da variação dos testes.
O Tier 1 do Inference Gateway está disponível nas regiões em que o add-on de inferência do SageMaker HyperPod já é oferecido. A instalação é feita com um único add-on e o recurso InferenceGatewayConfig, sem sidecars, service mesh ou mudanças no código.