El laboratorio de IA de shanghái y la universidad de shanghái jiao tong presentan un modelo ncp innovador
El 22 de septiembre de 2026, el Laboratorio de Inteligencia Artificial de Shanghái y la Escuela de Inteligencia Artificial de la Universidad de Shanghái Jiao Tong presentaron un nuevo paradigma de preentrenamiento para la Predicción de Conceptos Siguientes (NCP). Su modelo, NCP-ArchPreview, cuenta con un espacio latente discreto a escala de 8.9B y logra un rendimiento comparable al de OLMo-3-7B. El modelo se preentrenó con 5.73T de datos Dolma-3, utilizando solo el 51.3% del presupuesto de tokens para lograr resultados comparables, mejorando la velocidad de convergencia en 1.95 veces y la eficiencia computacional en 1.74 veces.
El NCP-ArchPreview emplea una tubería de procesamiento de espacio latente de tres etapas, utilizando la cuantificación de producto para construir un gran espacio de representación de conceptos. Predice conceptos futuros a través de la predicción diferenciable de conceptos siguientes y mecanismos de prevención de fugas causales, pasando de la predicción palabra por palabra a la predicción de conceptos en el espacio latente. El modelo también demostró un rendimiento superior en tareas posteriores, superando en 2.45 puntos y logrando una mejora de 6 puntos en la razón matemática GSM8K.
El equipo también descubrió que el ajuste fino de solo 17M de parámetros de espacio latente superaba a LoRA, sin olvidar problemas. La longitud de aceptación de la decodificación especulativa aumentó en un 4.17%, alcanzando el 7.59% en tareas de código. Los investigadores compartieron sus experiencias, construyeron un mecanismo de cribado de métricas proxy a escala de billones y pusieron a disposición de todos los recursos, incluidos los puntos de control y los marcos de evaluación.