Pular para o conteúdo
← Todas as notícias

NVIDIA detalha amostras em C++ para rodar IA local com ONNX Runtime e TensorRT RTX

O repositório DIN Deploy mostra como levar modelos para aplicativos nativos em Windows e Linux, com exportação para ONNX, aceleração por GPU e exemplos de áudio, imagens e texto.

A NVIDIA publicou o DIN Deploy, uma coleção de amostras em C++ para integrar modelos de IA a aplicativos locais. O foco é mostrar como usar o ONNX Runtime com o TensorRT RTX para levar um modelo em ONNX a um programa nativo em Windows e Linux, com suporte também a Arm64 em alguns presets.

NVIDIA detalha amostras em C++ para rodar IA local com ONNX Runtime e TensorRT RTX

Cada amostra começa com um exportador em Python que baixa um checkpoint do Hugging Face e o converte para ONNX. Do outro lado, há uma interface de linha de comando em C++ com ONNX Runtime. Essa divisão separa a conversão do modelo da lógica do aplicativo, e o código compartilhado usa as APIs padrão de sessão e tensor do ONNX Runtime; o trecho específico de GPU aparece só nos caminhos opcionais de aceleração.

O material inclui exemplos para transcrição de áudio offline e em tempo real, com Whisper, Parakeet TDT e Nemotron ASR Streaming, além de amostras do Meta SAM 2.1 para segmentação de imagens e vídeo. Também há um exemplo do FLUX.2-klein-4B para gerar imagens a partir de texto, com integração gráfica via Vulkan e DirectX.

A NVIDIA diz ainda que a quantização pós-treinamento com o Model Optimizer gera um modelo ONNX quantizado que pode substituir o original sem mudanças no código do aplicativo. O repositório traz presets de CMake para Windows e Linux, e o CMake baixa o ONNX Runtime e o TensorRT RTX por padrão.

← Todas as notícias