IA · 5 de octubre de 2026
Microsoft AI presenta nuevos modelos para transcripción y síntesis de voz
Microsoft AI ha lanzado MAI-Transcribe-2-Streaming, un nuevo modelo para la transcripción en tiempo real. Según Microsoft, ocupa el primer lugar en análisis artificial en términos de precisión. El modelo puede transcribir en 60 idiomas y ofrece resultados preliminares después de aproximadamente 100 milisegundos, lo que permite a los agentes de voz reaccionar incluso durante una oración.
Además, se han introducido dos modelos de síntesis de voz: MAI-Voice-2.1, que puede hablar en 23 idiomas con la misma voz y acento nativo. La variante MAI-Voice-2.1-Flash, según Microsoft, alcanza una latencia de 150 milisegundos y tiene un costo de 15 dólares por millón de caracteres, frente a los 22 dólares anteriores.
Ambos modelos son capaces de clonar voces a partir de unos pocos segundos de audio de referencia, y cuentan con mecanismos de protección para prevenir abusos. Están disponibles a través de Microsoft Foundry y MAI Playground, y los dos modelos de voz también se pueden acceder a través de OpenRouter. En una prueba, aproximadamente la mitad de los 4,000 participantes consideraron que las voces eran humanas.