A Amazon SageMaker Inference detalha o prefix-aware routing, uma estratégia que envia pedidos com o mesmo início de prompt para a mesma instância para reaproveitar o cache KV. Nos testes citados pela empresa com o Llama 3.1 70B, em sete instâncias ml.p5.48xlarge, o P50 do tempo até o primeiro token caiu até 77%, a taxa de acerto do cache KV passou de cerca de 25% para mais de 80% e a taxa de transferência subiu até 16%.

A ideia é simples: em aplicações de LLM, o começo do prompt costuma repetir instruções, documentos ou histórico de conversa. Sem esse roteamento, pedidos iguais podem cair em máquinas diferentes e cada uma refaz o mesmo trabalho. Com o novo esquema, o SageMaker olha o início do payload e tenta manter esses pedidos na mesma instância, o que favorece cenários como bots com instruções longas, conversas em várias rodadas e aplicações de busca com documentos anexados ao prompt.
A empresa também diz que o recurso evita sobrecarga quando uma instância já está no limite de concorrência configurado e que, ao aumentar ou reduzir a frota, a maior parte do tráfego continua indo para as mesmas máquinas. O custo do roteamento ficou entre 1,3 e 1,9 milissegundo por pedido, abaixo do TTFT medido nos testes, que variou de 63 a 280 milissegundos.
O prefix-aware routing está disponível hoje em endpoints de inferência em tempo real do SageMaker. Para funcionar, ele depende de cache de prefixo ativado no framework de inferência e usa os parâmetros PrefixLength e ConcurrencyThreshold na configuração do endpoint.