A SpaceXAI publicou detalhes do Grok Voice Transcribe 2.0, seu modelo mais recente de transcrição de fala. Segundo a empresa, ele é duas vezes mais preciso que o Grok Voice Transcribe 1.0, com o mesmo preço.

O modelo usa a base de áudio do Grok Voice, já empregada em dezenas de milhares de chamadas de suporte por dia, na transcrição de milhões de horas de narração em vídeo e em agentes de voz em produtos físicos, incluindo o assistente Grok em veículos Tesla. A empresa diz que o treinamento usou áudio ao vivo, com ruído, em vários idiomas e em ambientes diferentes.
No ranking público da Artificial Analysis, o Grok Voice Transcribe 2.0 aparece em primeiro lugar em precisão entre 32 modelos de streaming. Em medições internas com áudio de chamadas de suporte, conversas com o Grok, credenciais faladas como códigos de conta e e-mails, e comandos curtos em vários idiomas, o modelo superou o Grok Voice Transcribe 1.0 em todas as quatro bases. A maior melhora, segundo a SpaceXAI, foi em textos multilíngues: em frases curtas, a taxa de erro caiu de 20,6% para 6,8%.
O serviço detecta o idioma automaticamente e acompanha mudanças de idioma no meio da gravação. A empresa também afirma que integrações existentes da API de fala para texto funcionam sem mudanças de código. O preço segue em US$ 0,10 por hora de áudio em lote e US$ 0,20 por hora em streaming, com diarização, marcas de tempo e palavras-chave incluídas. A versão 1.0 será descontinuada nas próximas semanas, e quem quiser mantê-la deve fixar grok-voice-transcribe-1.0.