Shangtech revela modelo multimodal de código aberto com saída de imagem nativa em 4k
A ShangTech anunciou a disponibilização em código aberto do seu modelo multimodal grande e leve, SenseNova U1.5 Lite. O modelo suporta um comprimento de contexto de 3-4K e pode lidar com múltiplas restrições, como sujeito, quantidade, relações espaciais, texto, layout e estilo, melhorando a estabilidade de tarefas visuais complexas.
Possui geração visual aprimorada com melhor composição, cor, textura, iluminação, realismo e detalhes finos, reduzindo as ocorrências em que a precisão local não corresponde à conclusão geral.
O modelo também oferece capacidades de edição de imagem nativa mais confiáveis, incluindo identidade de sujeito aprimorada, estrutura espacial, relações de layout e preservação de áreas não editadas, juntamente com modificações locais, substituição de elementos, refinamento de texto e edição de imagem com múltiplas referências.
O SenseNova U1.5 Lite fortalece sua capacidade de lidar com layouts complexos, incluindo texto em chinês e inglês, cartazes, infográficos, elementos visuais de marca e formatação de texto múltipla, movendo-se da geração de conteúdo para a organização de expressões visuais completas.
Suporta controle visual preciso através de caixas delimitadoras, marcadores visuais e imagens de referência únicas ou múltiplas. O modelo também fornece saída nativa em 4K de alta resolução, equilibrando a composição geral com texturas finas, texto pequeno e refração de luz.
Como um modelo de 8B parâmetros, o SenseNova U1.5 Lite supera outros modelos de escala semelhante em acompanhamento de instruções e consistência de edição de imagem, alcançando um desempenho comparável a modelos comerciais grandes em renderização de texto e layouts complexos. O modelo está disponível no GitHub, Hugging Face e ModelScope.