Análisis y Opinión

Más allá de los números: la brecha entre modelos abiertos y cerrados es mucho más compleja que lo que sugieren los benchmarks

Anthropic + Google + OpenAIFuente: Nathan Lambert - Interconnects20/04/2026, 15:25
Si bien los modelos abiertos siempre rezagan respecto a los modelos cerrados, tratar esta brecha como una métrica única oculta matices cruciales sobre qué capacidades específicas importan realmente. Los benchmarks populares como el Artificial Analysis Intelligence Index no logran capturar cómo se desempeñan los modelos en implementaciones reales — una desconexión ejemplificada por las excepcionales puntuaciones de Gemini 3 en benchmarks pero su irrelevancia notable en sistemas agentic desplegados. Los laboratorios de frontera OpenAI y Anthropic invierten fuertemente en dominios especializados como derecho, sanidad y contabilidad, donde el desempeño depende de datos privados y experiencia de dominio indisponible para la mayoría de creadores de modelos abiertos. Los laboratorios de código abierto chino, mientras tanto, persiguen estrategias distintas como destilación de modelos y aprendizaje por refuerzo para reducir la brecha. Esto crea un panorama donde los benchmarks tradicionales proporcionan señales incompletas sobre las capacidades reales del modelo y el posicionamiento competitivo. El enfoque de la industria se desplaza cada 12 a 18 meses — desde chat y matemáticas hacia código y tareas agentic básicas, ahora hacia razonamiento complejo en campos especializados. Conforme el desempeño se estabiliza en dominios anteriores, surge una pregunta empresarial fundamental: ¿es mantener una ventaja de desempeño significativo en áreas focales actuales esencial para el crecimiento sostenido de ingresos, o el éxito dependerá cada vez más de relaciones con clientes, diferenciación de productos y fidelización de plataforma en lugar de superioridad pura de modelos?
Más allá de los números: la brecha entre modelos abiertos y cerrados es mucho más compleja que lo que sugieren los benchmarks — lupAI