Nuevos Desarrollos

Shangtech presenta un modelo multimodal de código abierto con salida de imagen nativa 4k

SenseNovaFuente: IT之家 (ITHome)21/08/2026, 08:09
ShangTech ha anunciado la apertura de su modelo multimodal grande y ligero, SenseNova U1.5 Lite. El modelo admite una longitud de contexto de 3-4K y puede manejar múltiples restricciones como sujeto, cantidad, relaciones espaciales, texto, diseño y estilo, mejorando la estabilidad de las tareas visuales complejas. Cuenta con una generación visual mejorada con una mejor composición, color, textura, iluminación, realismo y detalles finos, reduciendo las instancias en las que la precisión local no coincide con la finalización general. El modelo también ofrece capacidades de edición de imágenes nativas más fiables, incluyendo una identidad de sujeto mejorada, estructura espacial, relaciones de diseño y preservación de áreas no editadas, junto con modificaciones locales, reemplazo de elementos, refinamiento de texto y edición de imágenes con múltiples referencias mejoradas. SenseNova U1.5 Lite fortalece su capacidad para manejar diseños complejos, incluyendo texto en chino y inglés, carteles, infografías, elementos visuales de marca y formato de texto múltiple, pasando de la generación de contenido a la organización de expresiones visuales completas. Soporta un control visual preciso a través de cuadros delimitadores, marcadores visuales e imágenes de referencia individuales o múltiples. El modelo también proporciona una salida de alta resolución nativa de 4K, equilibrando la composición general con texturas finas, texto pequeño y refracción de la luz. Como modelo de 8B parámetros, SenseNova U1.5 Lite supera a otros modelos de escala similar en el seguimiento de instrucciones y la coherencia de la edición de imágenes, logrando un rendimiento comparable al de los grandes modelos comerciales en la renderización de texto y diseños complejos. El modelo está disponible en GitHub, Hugging Face y ModelScope.
Shangtech presenta un modelo multimodal de código abierto con salida de imagen nativa 4k — lupAI