Nuevos Desarrollos

Modelos de IA Dominan Tareas Complejas de Ingeniería y Automatización

Fable + OSWORLDFuente: Jack Clark - Import AI06/07/2026, 09:31
El modelo Fable estableció un nuevo récord al escribir el kernel de GPU más eficiente probado en el benchmark KernelBench-Mega, logrando una aceleración de 18,71 veces respecto a una línea base de PyTorch optimizada. Este logro ejemplifica cómo los sistemas de IA están desarrollando autónomamente componentes fundamentales para la investigación y desarrollo de IA, potencialmente creando bucles de auto-mejora. El progreso en automatización se extiende a tareas económicas reales. El Remote Labor Index, que evalúa la capacidad de sistemas de IA para ejecutar proyectos de trabajo remoto de manera completa, mostró una mejora dramática del 2,5% en octubre de 2025 al 16,1% en julio de 2026. Modelos recientes como Fable 5, GPT-5.5 y Opus 4.8 alcanzaron tasas de éxito de 16,1%, 6,3% y 8,3% respectivamente, indicando progreso acelerado en capacidades económicamente relevantes. Simultáneamente, investigadores lanzaron OSWORLD 2.0, un benchmark que evalúa la competencia de sistemas de IA en ejecutar tareas complejas multi-programa que duran horas. La tarea mediana requiere 1,6 horas para humanos, en contraste con 2 minutos en la versión anterior. Aunque los modelos actuales alcanzan solo 20,6% de precisión en pruebas completas, se anticipa una mejora de desempeño similar a la del benchmark 1.0. En China, la empresa JD implementó el Oxygen AI Item Center para gestionar su vasto catálogo de inventario, procesando cientos de millones de actualizaciones diarias usando NPUs Huawei Ascend, demostrando cómo el aprendizaje profundo se integra con sistemas estructurados en aplicaciones a escala de producción.
Modelos de IA Dominan Tareas Complejas de Ingeniería y Automatización — lupAI