Laboratório de IA de xangai e a universidade de xangai jiao tong apresentam um novo modelo ncp inovador
Em 22 de setembro de 2026, o Laboratório de Inteligência Artificial de Xangai e a Escola de Inteligência Artificial da Universidade de Xangai Jiao Tong lançaram um novo paradigma de pré-treinamento para a previsão de conceitos subsequentes (NCP). O modelo, NCP-ArchPreview, apresenta um espaço latente discreto em escala de 8,9B e atinge o mesmo desempenho do OLMo-3-7B. O modelo foi pré-treinado em 5,73T de dados Dolma-3, utilizando apenas 51,3% do orçamento de tokens para alcançar resultados comparáveis, melhorando a velocidade de convergência em 1,95 vezes e a eficiência computacional em 1,74 vezes.
O NCP-ArchPreview utiliza uma pipeline de processamento de espaço latente em três estágios, utilizando a quantização de produtos para construir um grande espaço de representação de conceitos. Ele prevê conceitos futuros através de previsão de conceitos subsequentes diferenciável e mecanismos de prevenção de vazamento causal, passando da previsão palavra por palavra para a previsão de conceitos no espaço latente. O modelo também demonstrou um desempenho superior em tarefas subsequentes, superando em 2,45 pontos e alcançando uma melhoria de 6 pontos na razão matemática GSM8K.
A equipe também descobriu que o ajuste fino de apenas 17M de parâmetros de espaço latente superou o LoRA, sem esquecer os problemas. O comprimento de aceitação da decodificação especulativa aumentou em 4,17%, atingindo 7,59% em tarefas de código. Os pesquisadores compartilharam suas experiências, construíram um mecanismo de triagem de métricas em escala de trilhões e disponibilizaram todos os ativos, incluindo checkpoints e frameworks de avaliação completos.