A NVIDIA publicou um guia sobre o Nemotron 3 Diarization, modelo de 100 milhões de parâmetros com pesos abertos que identifica quem falou e quando em conversas ao vivo ou gravadas. Ele separa até oito falantes e lida com sobreposição de vozes, o que permite atribuir trechos de fala com mais precisão em transcrições.

Segundo a postagem, o modelo alcançou 14,72% de taxa de erro de diarização no VoiceArena Diarization-Bench, ficando em primeiro lugar no ranking citado. A comparação usada pela NVIDIA aponta 19,3% para o segundo colocado no mesmo conjunto de testes.
O texto também explica que a diarização produz apenas os intervalos de fala de cada pessoa; para transformar isso em transcrição com autoria, é preciso combinar esses horários com reconhecimento automático de fala. As etiquetas geradas pelo modelo são anônimas, como speaker_2, e não identificam pessoas reais por conta própria.
A NVIDIA diz ainda que o Nemotron 3 aceita áudio mono de 16 kHz e pode operar em diferentes latências de entrada, com resultados medidos em testes internos da empresa. Esses números variam conforme o ambiente e o tipo de gravação, e a própria postagem ressalta que não devem ser tratados como latência final de um aplicativo completo.