A Microsoft detalha o MAI-Transcribe-2-Streaming, modelo de transcrição em tempo real que ficou em primeiro lugar em precisão no Artificial Analysis, tanto em transcrições finais quanto parciais. Segundo a empresa, ele gera as primeiras hipóteses em pouco mais de 100 ms após receber áudio e as ajusta à medida que o contexto chega, em vez de esperar a pessoa terminar de falar.

O modelo cobre 60 idiomas e faz detecção automática e contínua de idioma. A Microsoft diz ainda que, em suas avaliações internas, as palavras aparecem na transcrição duas vezes mais rápido do que no concorrente mais próximo em casos como ditado e legendas. O preço introdutório informado é de US$ 0,54 por hora de áudio até o fim do ano.
A empresa também apresenta o MAI-Voice-2.1 e o MAI-Voice-2.1-Flash. O primeiro oferece síntese de voz em 23 idiomas e 26 localidades, mantendo uma única voz com sotaque nativo ao alternar entre línguas. O Flash usa os mesmos idiomas e vozes cruzadas, mas foi voltado para maior volume e menor latência; a Microsoft diz que ele gera 45s de áudio com latência de ponta a ponta de 150 ms, custa US$ 15 por 1 milhão de caracteres e é cerca de 60% mais barato que modelos comparáveis.
Os dois modelos de voz suportam clonagem com poucos segundos de áudio de referência e trazem salvaguardas contra uso indevido. A empresa também mostrou uma demonstração chamada Chatter no MAI Playground para exibir os modelos juntos.