Fireworks AI presenta firerouter con opus, reduciendo los costes de codificación en un 57% con una mínima pérdida de precisión
Fireworks AI ha lanzado FireRouter con Opus, un modelo de enrutamiento consciente de la caché diseñado para optimizar el uso de la serie Claude Opus. La solución, ahora disponible a través de un punto final sin servidor, reduce los costes de codificación en un 57% al tiempo que mantiene una precisión del 98,1%, una disminución de 1,5 puntos porcentuales en comparación con el uso de Opus solo. FireRouter evalúa la idoneidad del modelo para cada tarea, equilibrando coste y calidad, y dirige al método más eficiente. La piscina de enrutamiento incluye Claude Opus5.5, GLM5.3 y GLM5.3Flash, con planes para expandirse a medida que se lancen nuevos modelos.
Las pruebas internas mostraron una reducción de costes del 57%, con los costes de sesión reducidos de 15,36 $ a 6,63 $. La precisión se mantuvo alta, con FireRouter obteniendo un 78,7 % en comparación con el 80,2 % de Opus solo. Las tasas de éxito de la caché también experimentaron una ligera disminución, con FireRouter logrando un 94,2 % en comparación con el 97,8 % de Opus. Fireworks AI ha señalado que esta compensación es intencional, ya que los modelos más baratos pueden manejar tareas rutinarias, reduciendo significativamente los costes generales.
Los datos de prueba se obtuvieron del tráfico de codificación interno, con sesiones asignadas aleatoriamente al grupo FireRouter con Opus o al grupo de control que utilizaba Opus solo. Los resultados destacan la eficacia del enrutamiento consciente de la caché para equilibrar el rendimiento y la eficiencia de costes.