Contrastive-LM apresenta o CLM-8B, um novo modelo de código aberto que supera o jev na avaliação de ações de agentes
A Contrastive-LM lançou o CLM-8B, um modelo de código aberto projetado para avaliar ações de agentes até 9 vezes mais rápido do que o sistema proprietário Jev da TypeSafe AI. O CLM-8B opera avaliando ações candidatas em relação ao estado atual, retornando probabilidades em vez de gerar texto. É compatível com a API da TypeSafe e executa em uma única GPU NVIDIA sob Linux, utilizando o framework vLLM.
O modelo utiliza uma perda InfoNCE bidirecional para treinar codificadores de estado e ação, cada um construído em um Qwen3-8B de fundo congelado com uma cabeça de projeção treinável. Na inferência, o CLM avalia ações usando produtos de ponto de embeddings, com a softmax gerando a distribuição final. Em tarefas de referência como T-Rex, o CLM atinge o mesmo desempenho que o Jev, embora fique atrás em chamadas de ferramentas e WikiRacing.
A pré-treinamento alcança 52,1% de precisão top-1, aumentando para 69,2% durante o treinamento. O CLM é 13 vezes mais rápido que o Jev em 1.000 candidatos, com melhorias de latência em um H100. A equipe de pesquisa afirma novos resultados de ponta, com o CLM superando o Jev em benchmarks externos.