A NVIDIA publicou o DIN Deploy, uma coleção de amostras em C++ para integrar modelos de IA a aplicativos locais. O foco é mostrar como usar o ONNX Runtime com o TensorRT RTX para levar um modelo em ONNX a um programa nativo em Windows e Linux, com suporte também a Arm64 em alguns presets.

Cada amostra começa com um exportador em Python que baixa um checkpoint do Hugging Face e o converte para ONNX. Do outro lado, há uma interface de linha de comando em C++ com ONNX Runtime. Essa divisão separa a conversão do modelo da lógica do aplicativo, e o código compartilhado usa as APIs padrão de sessão e tensor do ONNX Runtime; o trecho específico de GPU aparece só nos caminhos opcionais de aceleração.
O material inclui exemplos para transcrição de áudio offline e em tempo real, com Whisper, Parakeet TDT e Nemotron ASR Streaming, além de amostras do Meta SAM 2.1 para segmentação de imagens e vídeo. Também há um exemplo do FLUX.2-klein-4B para gerar imagens a partir de texto, com integração gráfica via Vulkan e DirectX.
A NVIDIA diz ainda que a quantização pós-treinamento com o Model Optimizer gera um modelo ONNX quantizado que pode substituir o original sem mudanças no código do aplicativo. O repositório traz presets de CMake para Windows e Linux, e o CMake baixa o ONNX Runtime e o TensorRT RTX por padrão.