Google presenta rrsi: un marco de IA que permite la auto-mejora sin sobreajuste
Google Cloud AI Research, en colaboración con UNC-Chapel Hill, Stanford y la Universidad de Washington en St. Louis, ha lanzado RRSI (Regularized Recursive Self-Improvement), un marco que permite a los modelos de lenguaje grandes (LLMs) reescribir sus propios componentes, incluyendo indicaciones, herramientas, memoria y flujo de control, sin alterar los pesos del modelo. El sistema restringe el bucle de mejora para garantizar que las ganancias sean consistentes en los conjuntos de datos en los que el agente no ha optimizado.
RRSI se puede utilizar como un marco de investigación, utilizando la licencia Apache 2.0 y requiriendo Python 3.10+. Admite cualquier cadena de modelo LiteLLM, con valores predeterminados que asumen Claude Opus 4.8 en Vertex AI. El marco mejora el rendimiento en conjuntos de datos como Terminal-Bench 2.1, donde las puntuaciones aumentaron de 64.6 a 78.7, y SWE-bench Verified, que aumentó de 76.8 a 79.0. El equipo de investigación también destaca una reducción del 30% en los tokens de política por prueba, y la página del proyecto indica una mejora del 36%.
El marco aborda tres modos de fallo: ajuste específico del conjunto de datos, persecución del ruido y acumulación de complejidad. Al regularizar el proceso de búsqueda, RRSI mantiene presupuestos de edición similares a L0, poda similar a Lasso (L1) y reglas de coste similares a Ridge (L2). Supera a otros métodos en el rendimiento fuera de la distribución, con un promedio OOD más de 1 punto por encima de la línea base.