Prime intellect presenta prime inference para un servicio de modelos eficiente
Prime Intellect ha lanzado Prime Inference, una plataforma diseñada para servir modelos de código abierto de última generación. La plataforma ofrece puntos finales sin servidor y capacidad de GPU reservada en múltiples centros de datos. Antes de su lanzamiento público, procesó casi un billón de tokens diariamente, impulsado por despliegues de RL, generación de datos sintéticos, evaluaciones y agentes de codificación de larga duración. Prime Inference es parte del conjunto de herramientas de entrenamiento de código abierto de Prime Intellect, que incluye herramientas como prime-rl, verificadores y entornos de prueba. La capa de servicio permite que los modelos desplegados generen trazas de producción que alimentan el entrenamiento. Prime informa que su punto final GLM-5.3 se encuentra entre los más rápidos en OpenRouter, con una tasa de error de llamada de herramientas casi nula y un tiempo de actividad del 100% desde el lanzamiento.
La plataforma integra NVIDIA Dynamo, vLLM, Mooncake y FlashInfer, con contribuciones de Inferact y NVIDIA. Está optimizada para cargas de trabajo basadas en agentes, donde un turno típico de agente añade aproximadamente 6.000 tokens a un prompt de 140.000 tokens. Prime lo evalúa con SemiAnalysis AgentX e entradas frías inyectadas. Los procesos de prellenado y decodificación se ejecutan en grupos de GPU separados, con Dynamo que gestiona el enrutamiento y vLLM que ejecuta el modelo. Los decodificadores recuperan KV calculado a través de NIXL, logrando una latencia inter-token p90 casi un 40% más baja. El enrutamiento consciente de la caché, gestionado por el enrutador KV de Dynamo, mantiene las sesiones en el mismo decodificador entre turnos, con Mooncake que añade una segunda capa KV en la DRAM del host.