Análises & Opinião

Controle adaptativo do esforço de raciocínio em modelos de linguagem

DeepSeek + OpenAI + QwenFonte: Sebastian Raschka18/07/2026, 08:16
Os modelos de linguagem com capacidade de raciocínio transformaram-se numa componente padrão dos lançamentos modernos de IA. Desde que a OpenAI popularizou o modelo o1, seguido pela DeepSeek-R1 e técnicas de aprendizado por reforço com recompensas verificáveis (RLVR), as capacidades de raciocínio passo-a-passo tornaram-se centrais no desenvolvimento de LLMs. O mais recente lançamento da OpenAI, a família GPT-5.6, integra diferentes configurações de esforço de raciocínio ajustáveis. Existem duas estratégias principais para melhorar o desempenho em tarefas de raciocínio: scaling durante o treino e scaling durante a inferência. O método RLVR treina modelos através de reforço em domínios verificáveis, como matemática e programação, permitindo aos modelos aprender a gerar explicações intermédias, auto-corrigir-se e resolver problemas complexos de forma estruturada. Uma evolução significativa foi a introdução de modelos híbridos, como Qwen3, que permitem alternar entre modo de raciocínio ativo e desativo mediante configuração. Durante o treino, estes modelos veem exemplos com e sem raciocínio, com a fusão de modos implementada através de fine-tuning supervisionado seguido de aprendizado por reforço adicional. Os níveis de esforço de raciocínio controlam a extensão do raciocínio e a precisão das respostas, escalando directamente o uso de tokens computacionais. As etiquetas de raciocínio funcionam como delimitadores de formatação sem capacidade inerente de raciocínio, permitindo separar o trace de raciocínio da resposta final para apresentação ao utilizador. A performance atual destes modelos sugere que o controle de esforço de raciocínio é fundamental na arquitetura moderna dos LLMs.
Controle adaptativo do esforço de raciocínio em modelos de linguagem — lupAI