Pular para o conteúdo
← Todas as notícias

NVIDIA detalha Nemotron 3 Diarization, modelo que separa falas de até oito pessoas

Em postagem no Hugging Face, a NVIDIA apresenta o Nemotron 3 Diarization, com pesos abertos, e mostra resultados do modelo em benchmark de diarização e em cenários de áudio ao vivo e gravado.

A NVIDIA publicou um guia sobre o Nemotron 3 Diarization, modelo de 100 milhões de parâmetros com pesos abertos que identifica quem falou e quando em conversas ao vivo ou gravadas. Ele separa até oito falantes e lida com sobreposição de vozes, o que permite atribuir trechos de fala com mais precisão em transcrições.

NVIDIA detalha Nemotron 3 Diarization, modelo que separa falas de até oito pessoas

Segundo a postagem, o modelo alcançou 14,72% de taxa de erro de diarização no VoiceArena Diarization-Bench, ficando em primeiro lugar no ranking citado. A comparação usada pela NVIDIA aponta 19,3% para o segundo colocado no mesmo conjunto de testes.

O texto também explica que a diarização produz apenas os intervalos de fala de cada pessoa; para transformar isso em transcrição com autoria, é preciso combinar esses horários com reconhecimento automático de fala. As etiquetas geradas pelo modelo são anônimas, como speaker_2, e não identificam pessoas reais por conta própria.

A NVIDIA diz ainda que o Nemotron 3 aceita áudio mono de 16 kHz e pode operar em diferentes latências de entrada, com resultados medidos em testes internos da empresa. Esses números variam conforme o ambiente e o tipo de gravação, e a própria postagem ressalta que não devem ser tratados como latência final de um aplicativo completo.

Redação em português com apoio de IA, a partir de Hugging Face. Curadoria de Thiago Felizola.

Ler a notícia original
← Todas as notícias