Análisis y Opinión

Los agentes de IA ya pueden realizar trabajo económicamente valioso

Anthropic + OpenAIFuente: Ethan Mollick - One Useful Thing29/09/2025, 15:52
OpenAI presentó un nuevo benchmark que compara el desempeño de IA contra expertos humanos en tareas realistas que requieren de cuatro a siete horas para completarse. Los resultados muestran que los modelos de IA se acercan al nivel de rendimiento humano en varios sectores, con variaciones según la industria. Sorprendentemente, la razón principal de bajo desempeño no fue alucinaciones o errores, sino formateo deficiente de resultados e incapacidad para seguir instrucciones precisas—áreas que muestran mejoras rápidas. Aunque la capacidad de ejecutar tareas individuales no implica sustitución laboral inmediata—ya que los trabajos involucran múltiples funciones—existen áreas donde la IA ya aporta valor significativo. La replicación de investigación científica ejemplifica este potencial: un proceso que normalmente requiere muchas horas de trabajo meticuloso puede ser automatizado. Modelos como Claude Sonnet 4.5 han demostrado capacidad para analizar independientemente papers complejos, convertir código estadístico y reproducir hallazgos con precisión. Los agentes de IA han logrado mejoras dramáticas en su autonomía. Los pequeños avances en precisión de modelos se traducen en crecimiento exponencial del alcance de tareas que pueden completar. Los modelos de última generación son auto-correctivos, permitiendo recuperación de errores sin fallos completos. Existe un riesgo significativo: desplegar IA sin reflexión para generar contenido innecesario. La solución radica en que expertos trabajen deliberadamente con estos agentes—delegando tareas como primer intento y revisando resultados. La investigación indica que este flujo puede mejorar productividad en 40% mientras reduce costos en 60%, manteniendo expertos en control del proceso.
Los agentes de IA ya pueden realizar trabajo económicamente valioso — lupAI