lupAI
pesquisa

Perplexity mejora la precisión de la IA aprendiendo de los errores reales mediante técnicas guiadas por indicaciones

PerplexityFuente: MarkTechPost25/09/2026, 13:15
Perplexity Research ha introducido un nuevo método para mejorar la precisión de la IA, entrenando sus modelos en sesiones reales de usuarios, incluidas aquellas que fallaron. El enfoque combina el ajuste fino mediante muestreo de rechazo con la auto-destilación guiada por indicaciones, lo que resulta en una reducción del 21,2 % en los fallos de llamada a herramientas, de 2,24 % a 1,77 %, en pruebas A/B en vivo. El modelo, que se ejecuta en Perplexity Computer, utiliza GLM 5.2 como base y está disponible en Hugging Face. La técnica separa las sesiones en aquellas exitosas y fallidas, utilizando indicaciones para corregir los errores. Las indicaciones son instrucciones cortas basadas en el conocimiento existente del modelo, como la sugerencia de valores válidos para una consulta de búsqueda. El método de auto-destilación de políticas (OPSD) implica ejecutar el mismo punto de control dos veces, con el pase del maestro utilizando indicaciones y el pase del estudiante sin, para refinar el aprendizaje del modelo. La función de pérdida combinada incluye la entropía cruzada y un término de divergencia KL, con λ que controla el equilibrio entre los dos. Las sesiones se filtran para la elegibilidad de entrenamiento, excluyendo aquellas con información personal identificable. Los jueces de LLM califican las tareas en una escala de 5 puntos, y dos deben aprobar para que una sesión se considere exitosa. El feedback del usuario implica que tres jueces de LLM identifican la causa raíz, con al menos dos de acuerdo. Este proceso ayuda a reducir el sesgo de retrospectiva al comprobar las indicaciones en función de la información disponible antes de que ocurriera el error.
Perplexity mejora la precisión de la IA aprendiendo de los errores reales mediante técnicas guiadas por indicaciones — lupAI