Prime intellect lança prime inference para servir modelos de forma eficiente
A Prime Intellect lançou o Prime Inference, uma plataforma projetada para servir modelos de código aberto de ponta. A plataforma oferece endpoints sem servidor e capacidade de GPU reservada em vários data centers. Antes do lançamento público, processou quase um trilhão de tokens diariamente, impulsionado por lançamentos de RL, geração de dados sintéticos, avaliações e agentes de codificação de longa duração. O Prime Inference faz parte da pilha de treinamento aberta da Prime Intellect, que inclui ferramentas pós-treinamento como prime-rl, verificadores e sandboxes. A camada de serviço permite que os modelos implantados gerem rastros de produção que alimentam o treinamento. A Prime relata que seu endpoint GLM-5.3 está entre os mais rápidos no OpenRouter, com uma taxa de erro de chamadas de ferramentas quase zero e 100% de tempo de atividade desde o lançamento.
A plataforma integra NVIDIA Dynamo, vLLM, Mooncake e FlashInfer, com contribuições de Inferact e NVIDIA. É otimizada para cargas de trabalho agentes, onde uma típica rodada de agente adiciona cerca de 6.000 tokens a um prompt de 140.000 tokens. A Prime avalia isso com SemiAnalysis AgentX e chegadas frias injetadas. Os processos de preenchimento e decodificação são executados em grupos de GPU separados, com o Dynamo gerenciando o roteamento e o vLLM executando o modelo. Os decodificadores recuperam o KV computado através do NIXL, alcançando quase 40% menor latência inter-token p90. O roteamento consciente de cache, gerenciado pelo roteador KV-aware do Dynamo, mantém as sessões no mesmo decodificador entre as rodadas, com o Mooncake adicionando uma segunda camada KV no DRAM do host.