lupAI
novos-desenvolvimentos

Alibaba presenta un modelo de audio avanzado con capacidades de interacción en tiempo real

AlibabaFuente: MarkTechPost29/09/2026, 02:58
El equipo de Qwen de Alibaba ha lanzado Qwen-Audio-3.1, una pila de audio completa que abarca el reconocimiento automático del habla (ASR), la síntesis del habla (TTS) e interacción en tiempo real. El modelo principal, Qwen-Audio-3.1-Realtime, es un modelo de voz de doble vía diseñado para agentes de voz que pueden interactuar con herramientas. El precio de ASR se ha reducido hasta un 95%, con descuentos del 70% en TTS y del 85% en Realtime. El modelo está disponible como una API gestionada a través de WebSocket en QwenCloud, sin pesos abiertos. El sistema utiliza dos modelos con el mismo codificador de audio y diseño de LLM. Un modelo de decisión de doble vía predice si escuchar, hablar, detener o reanudar, mientras que un modelo de voz a texto convierte las respuestas en voz en streaming. El entrenamiento implica tres capas: Pensar, Actuar y Hablar y Coordinar, utilizando Core-Cocktail SFT, Multimodality OPD y GRPO para refinar el modelo. El rendimiento del modelo ha mejorado en varios puntos de referencia, incluyendo una reducción de las tasas de relleno y capacidades multilingüísticas mejoradas. Los detalles de precios se confirmaron a partir del 28 de septiembre de 2026, con tasas de tokens variables debido a los diferentes métodos de tokenización de audio entre proveedores. El lanzamiento incluye modelos adicionales como Qwen-Audio-3.1-ASR-Flash-Filetrans, que se centra en la transcripción de audio de larga duración sin conexión. Alibaba también anima a la participación a través de las redes sociales y oportunidades de colaboración para socios.
Alibaba presenta un modelo de audio avanzado con capacidades de interacción en tiempo real — lupAI