Pular para o conteúdo
← Todas as notícias

Hugging Face detalha tokenizers v1, com encode 3 a 30 vezes mais rápido que a v0.23

A versão candidata do tokenizers v1 mantém os mesmos IDs de saída da v0.23 e traz ganhos de desempenho medidos em testes no Apple M4 Max.

A Hugging Face detalha a versão 1 do tokenizers, biblioteca que converte texto em números para modelos de IA. Nos testes citados pela empresa, a nova versão codifica texto de 3 a 30 vezes mais rápido que a v0.23 em um Apple M4 Max, com o menor ganho em t5-base e o maior em gpt2. O material também mostra escala de 76% com oito workers.

Hugging Face detalha tokenizers v1, com encode 3 a 30 vezes mais rápido que a v0.23

Segundo a empresa, a v1 preserva o resultado da versão anterior: produz exatamente os mesmos IDs de token, mantém a API, o vocabulário e as regras de mesclagem, e continua compatível com os mesmos modelos suportados pela v0.23. A biblioteca segue cobrindo BPE, WordPiece e Unigram.

Os ganhos vêm de mudanças em pontos diferentes do processo. Em vez de usar um motor genérico de expressões regulares para separar partes do texto, a v1 usa uma função escrita à mão para padrões reconhecidos e aproveita instruções SIMD do processador. Ela também guarda em cache o resultado de palavras repetidas, reutiliza memória entre chamadas e processa vários pré-tokens em uma única chamada do modelo.

A própria Hugging Face ressalta que nem todos os modelos se beneficiam do mesmo jeito: quando o padrão de separação não entra nas regras reconhecidas, a biblioteca continua usando o caminho com expressões regulares. Um release candidate da v1 está no crates.io.

Redação em português com apoio de IA, a partir de Hugging Face. Curadoria de Thiago Felizola.

Ler a notícia original
← Todas as notícias