Nuevos Desarrollos

Alibaba lanza qwen-ui-agent para que los modelos puedan "utilizar" realmente cualquier pantalla

AlibabaFuente: IT之家 (ITHome)21/08/2026, 08:38
Alibaba ha lanzado oficialmente Qwen-UI-Agent, un modelo fundamental de agente inteligente con interfaz gráfica diseñado para operar eficazmente en entornos del mundo real, incluyendo dispositivos móviles, ordenadores, navegadores web y DeepSearch. El modelo demuestra un rendimiento sólido en múltiples pruebas, superando a los modelos líderes en varias categorías. En tareas móviles, Qwen-UI-Agent obtuvo un 82,1% en MobileWorld, superando a GPT-5.6 Sol, Claude Opus 4.8 y Seed 2.1 Pro en 12,0, 14,6 y 8,9 puntos porcentuales, respectivamente. También obtuvo un 92,2% en MobileWorld-Real, superando a Gemini 3.1 Pro, Claude Opus 4.8 y GPT-5.6 Sol. En tareas de escritorio, obtuvo un 79,5% en OSWorld-Verified, superando a GPT-5.5, Gemini 3.1 Pro y Seed 2.1 Pro. También logró un 40,0% en OSWorld-v2 Partial, con una reducción del 58% en los pasos de ejecución en comparación con la línea base. En tareas de web y DeepSearch, obtuvo un 73,6% en WebArena, el más alto entre todos los modelos comparados, y un 75,0% en BrowseComp-ZH. En tareas de anclaje a la interfaz gráfica, obtuvo un 81,5% en ScreenSpot-Pro, estableciendo nuevos récords de última generación en cuatro otros benchmarks. El modelo también destaca en capacidades generales y de agente, superando tanto a los modelos base de entrenamiento como a los modelos específicos de la interfaz gráfica. Opera en un entorno del mundo real con más de 100 teléfonos reales y 150 aplicaciones, utilizando su propio benchmark MobileWorld-Real con más de 400 tareas y 100 aplicaciones. El modelo está diseñado para manejar tareas complejas y de largo alcance en escenarios del mundo real. Integra comprobaciones de seguridad a lo largo de la ejecución de la tarea, rechazando cualquier acción de interfaz para solicitudes ilegales o de alto riesgo, y pausando para la confirmación del usuario en operaciones sensibles como pagos, eliminación de datos y autorización de privacidad. Además, admite operaciones de línea de comandos y acciones en lote, con casi la mitad de las acciones en tareas de escritorio en lote, lo que mejora significativamente la eficiencia. El modelo también puede realizar aprendizaje por refuerzo en línea durante más de 100 pasos, con aproximadamente 10.000 entornos concurrentes que se ejecutan simultáneamente. El proyecto está disponible en https://tongyi-mai.github.io/Qwen-UI-Agent y en GitHub en https://github.com/Tongyi-MAI/MAI-UI.
Alibaba lanza qwen-ui-agent para que los modelos puedan "utilizar" realmente cualquier pantalla — lupAI