Tutoriales y Guías

Configurando un Agente de Programación Local con Modelos Abiertos

Cohere + Ollama + QwenFuente: Sebastian Raschka27/06/2026, 08:21
Un tutorial práctico para configurar un agente de programación local completamente independiente, sin dependencia de servicios propietarios. El sistema combina un LLM servido localmente con un harness de programación capaz de leer archivos, realizar ediciones, ejecutar comandos y verificar cambios. Este enfoque ofrece transparencia completa, funciona con costo mínimo (solo hardware y electricidad) y permanece bajo control total del usuario, permitiendo modificaciones arbitrarias del harness. El artículo describe varias ventajas de las configuraciones locales frente a servicios propietarios como GPT in Codex o Claude Code: costos fijos predecibles después de la inversión en hardware, reproducibilidad de modelos sin actualizaciones inesperadas, y capacidad de funcionamiento offline. También se abordan consideraciones de privacidad—por ejemplo, procesar recibos localmente en lugar de enviar datos a OpenAI o Anthropic. La implementación se enfoca principalmente en Qwen3.6 35B-A3B emparejado con el harness Qwen-Code, elegido porque este modelo está específicamente optimizado para ese entorno. El Qwen3.6 requiere aproximadamente 30-40 GB de RAM y descarga unos 22 GB, ofreciendo actualmente el mejor rendimiento en su clase de tamaño según benchmarks recientes. La configuración sigue siendo compatible con otros harnesses populares como Claude Code y Codex, así como con modelos alternativos como North Mini Code 1.0 de Cohere. El tutorial detalla el uso de Ollama como framework eficiente de servicio de modelos, seleccionado por su simplicidad de instalación y compatibilidad multiplataforma. Ollama proporciona servicio de modelos local optimizado mientras opcionalmente permite acceso a modelos alojados en la nube cuando sea necesario. La guía incluye instrucciones prácticas para descargar modelos y evaluar rendimiento, contando con un script de benchmark para medir velocidad (tokens por segundo) y uso de memoria en diferentes tamaños de contexto.
Configurando un Agente de Programación Local con Modelos Abiertos — lupAI