Tutoriais & Guias

Configurando um Agente de Programação Local com Modelos Abertos

Cohere + Ollama + QwenFonte: Sebastian Raschka27/06/2026, 08:21
Um tutorial prático para configurar um agente de programação local completamente independente, sem dependências de serviços proprietários. O sistema utiliza um LLM servido localmente junto com uma harness de programação que consegue ler ficheiros, fazer edições, executar comandos e verificar alterações. A configuração oferece transparência total, pode ser executada gratuitamente (apenas com custos de hardware e eletricidade) e permanece completamente sob controlo do utilizador, permitindo modificações arbitrárias da harness. O artigo apresenta vários motivos pelos quais uma configuração local pode ser preferível a serviços como GPT in Codex ou Claude Code: custos previsíveis e fixos após investimento inicial em hardware, reprodutibilidade de modelos sem actualizações inesperadas, e capacidade de funcionamento offline. Também aborda considerações de privacidade - por exemplo, processar recibos localmente em vez de enviar dados para OpenAI ou Anthropic. Para a implementação, o tutorial foca-se principalmente no Qwen3.6 35B-A3B com a harness Qwen-Code, por ser um modelo especificamente optimizado para este ambiente. O Qwen3.6 requer cerca de 30-40 GB de RAM e descarrega aproximadamente 22 GB, mas oferece actualmente a melhor performance na sua classe de tamanho segundo benchmarks recentes. A configuração também é compatível com outras harnesses populares como Claude Code e Codex, bem como com modelos alternativos como o North Mini Code 1.0 do Cohere. O texto detalha como usar Ollama como framework eficiente de serving de modelos, pela sua simplicidade de instalação e uso em diferentes sistemas operativos. Ollama permite servir modelos localmente com performance optimizada, oferecendo também a opção de aceder a modelos cloud quando necessário. O tutorial inclui instruções práticas para download de modelos e avaliação de performance, incluindo um script de benchmark para medir velocidade (tokens por segundo) e uso de memória em diferentes contextos de tamanho.
Configurando um Agente de Programação Local com Modelos Abertos — lupAI