A NVIDIA detalha o CUDA Toolkit 13.4 com suporte ao Windows on Arm, estendendo ao Windows em Arm uma capacidade que já existia em Linux para essa plataforma. A empresa também adiciona suporte preliminar à arquitetura Rubin, com capacidade de computação 107, para que desenvolvedores comecem a adaptar aplicações antes da disponibilidade geral em uma futura versão do toolkit.

Outra mudança é o MPS V3, que reorganiza o controle de recursos para GPUs compartilhadas. A versão traz linha de comando para automação, instâncias nomeadas, namespaces, suporte a TOML, controle de partição de SMs e limites de memória de GPU integrados ao cgroup. A ideia é permitir divisão mais precisa de memória, execução e prioridade em ambientes com vários processos.
O pacote também inclui o CUDA Compute Fabric Transport, voltado a bibliotecas de comunicação que precisam mover dados por NVLink com endpoints lógicos, além de consultas de localidade para memória unificada. Essas APIs ajudam a saber onde os dados estão e a decidir melhor quando mover memória ou executar tarefas, mas a NVIDIA diz que a maioria dos desenvolvedores continua melhor atendida por bibliotecas como NCCL ou NVSHMEM.
Entre os ajustes de plataforma, os instaladores do CUDA SDK deixam de trazer o driver NVIDIA junto. Em sistemas coerentes como Grace Hopper, Grace Blackwell e Vera Rubin, o driver passa a usar CDMM por padrão, embora o modo NUMA siga disponível por parâmetro do módulo do kernel. O release também amplia a compatibilidade com GCC 16 e Clang 22 e atualiza CUDA Python e CCCL 3.4.