Microsoft presenta un modelo de conversión de voz a texto en tiempo real con una tasa de error de palabras del 2,5%
Microsoft ha lanzado su primer modelo de transmisión de voz a texto en tiempo real, MAI-Transcribe-2-Streaming, capaz de transcribir 60 idiomas con detección automática de idioma.
El modelo, disponible a un precio reducido de 0,54 $ por hora (aproximadamente 3,6 RMB), ofrece una demora de 0,13 segundos y una tasa de error de palabras del 2,5%, superando a otros 28 modelos de transmisión.
En las pruebas, logró una demora final de transcripción de 0,13 segundos y una tasa de error de palabras del 2,5%, superando a competidores como Grok Voice Transcribe 2.0 Streaming y ElevenLabs Scribe v2 Realtime.
El modelo proporciona texto parcial en 100 milisegundos y lo refina a medida que se dispone de más contexto, lo que permite aplicaciones en tiempo real como el servicio al cliente y las subtítulos en vivo. Microsoft también destacó su contraparte sin transmisión, MAI-Transcribe-2, que tiene una tasa de error de palabras promedio del 5,2% y está diseñada para tareas posteriores a la grabación.