A Hugging Face detalha a versão 1 do tokenizers, biblioteca que converte texto em números para modelos de IA. Nos testes citados pela empresa, a nova versão codifica texto de 3 a 30 vezes mais rápido que a v0.23 em um Apple M4 Max, com o menor ganho em t5-base e o maior em gpt2. O material também mostra escala de 76% com oito workers.

Segundo a empresa, a v1 preserva o resultado da versão anterior: produz exatamente os mesmos IDs de token, mantém a API, o vocabulário e as regras de mesclagem, e continua compatível com os mesmos modelos suportados pela v0.23. A biblioteca segue cobrindo BPE, WordPiece e Unigram.
Os ganhos vêm de mudanças em pontos diferentes do processo. Em vez de usar um motor genérico de expressões regulares para separar partes do texto, a v1 usa uma função escrita à mão para padrões reconhecidos e aproveita instruções SIMD do processador. Ela também guarda em cache o resultado de palavras repetidas, reutiliza memória entre chamadas e processa vários pré-tokens em uma única chamada do modelo.
A própria Hugging Face ressalta que nem todos os modelos se beneficiam do mesmo jeito: quando o padrão de separação não entra nas regras reconhecidas, a biblioteca continua usando o caminho com expressões regulares. Um release candidate da v1 está no crates.io.