Análisis y Opinión

Control adaptativo del esfuerzo de razonamiento en modelos de lenguaje

DeepSeek + OpenAI + QwenFuente: Sebastian Raschka18/07/2026, 08:16
Los modelos de lenguaje con capacidad de razonamiento se han convertido en un componente estándar en los lanzamientos modernos de IA. Desde que OpenAI popularizó el modelo o1, seguido por DeepSeek-R1 y técnicas de aprendizaje por refuerzo con recompensas verificables (RLVR), las capacidades de razonamiento paso a paso se han vuelto centrales en el desarrollo de LLMs. La última familia GPT-5.6 de OpenAI integra configuraciones de esfuerzo de razonamiento ajustables en múltiples tamaños de modelo. Dos estrategias principales mejoran el desempeño en tareas de razonamiento: scaling en el entrenamiento e scaling en la inferencia. El método RLVR entrena modelos mediante señales de refuerzo en dominios verificables como matemáticas y código, permitiendo que los modelos aprendan a generar explicaciones intermedias, autocorregirse y resolver problemas complejos de manera sistemática. Una evolución significativa ha sido la introducción de modelos híbridos como Qwen3 que permiten alternar entre modos de razonamiento activo e inactivo mediante configuración. Durante el entrenamiento, estos modelos encuentran ejemplos tanto de razonamiento como sin razonamiento, con la fusión de modos implementada mediante fine-tuning supervisado seguido de aprendizaje por refuerzo adicional. Los niveles de esfuerzo de razonamiento controlan el alcance del razonamiento y la precisión de las respuestas, escalando directamente el uso de tokens computacionales. Los delimitadores de razonamiento funcionan como marcadores de formato sin capacidad de razonamiento inherente, permitiendo separar trazas de razonamiento de respuestas finales para presentación al usuario. El desempeño actual de los modelos sugiere que el control del esfuerzo de razonamiento es fundamental para la arquitectura moderna de LLMs.
Control adaptativo del esfuerzo de razonamiento en modelos de lenguaje — lupAI