Pular para o conteúdo
← Todas as notícias

TensorRT Edge-LLM detalha benchmark de agentes no Jetson AGX Thor com resultado 6,4x

No MLPerf Inference v6.1 Edge Agentic, a NVIDIA mostrou o TensorRT Edge-LLM rodando Qwen3.6-27B em um Jetson AGX Thor Developer Kit e concluiu a carga em 24 minutos e 36 segundos.

A NVIDIA mostrou o desempenho do TensorRT Edge-LLM no MLPerf Inference v6.1 Edge Agentic, com o modelo Qwen3.6-27B rodando em um único Jetson AGX Thor Developer Kit de 128 GB de memória unificada. Na submissão, o sistema completou a carga em 24 minutos e 36 segundos, taxa de 52,33 tokens por segundo.

TensorRT Edge-LLM detalha benchmark de agentes no Jetson AGX Thor com resultado 6,4x

O resultado é comparado com a referência do próprio ecossistema MLCommons, que usa llama.cpp com Qwen3.6-27B e quantização Q4_K_M no mesmo hardware. Nesse caso, a execução levou 2 horas e 37 minutos, o que coloca a submissão da NVIDIA como 6,4 vezes mais rápida nesse teste específico.

O benchmark mede agentes de IA que não respondem a um único pedido: eles seguem uma sequência de passos, chamam ferramentas, avaliam a resposta e continuam a conversa. A fase de desempenho reproduz 20 trajetórias de engenharia de software, com 1.007 turnos gerados e entradas que chegam a cerca de 23,5 mil tokens.

A publicação atribui o resultado a três técnicas: quantização NVFP4 para pesos e ativações, reuso do cache de atenção e predição de vários tokens em árvore. A própria fonte também observa que o reuso ajudou a evitar recomputar histórico longo, com cerca de 96% dos tokens de prompt atendidos pelo cache, e que a árvore de predição pode avançar mais de um token quando a verificação aceita mais de uma opção.

A implementação usada na submissão está no branch release/0.9.1-mlpinf do TensorRT Edge-LLM, com instruções de exportação do checkpoint, construção dos motores e execução do benchmark.

← Todas as notícias