ByteDance revela SeedRealtime, um LLM áudio-visual full-duplex
A equipe Seed da ByteDance apresentou SeedRealtime, um modelo de linguagem grande áudio-visual nativo capaz de conversa full-duplex em tempo real. O modelo funde áudio, vídeo e texto em uma arquitetura unificada única, permitindo audição e fala simultâneas com timing de conversa natural. Atualmente implantado no assistente Doubao da ByteDance, SeedRealtime representa uma mudança de arquiteturas em cascata que encadeiam componentes separados, movendo percepção e tomada de decisão para processamento paralelo dentro de um único modelo end-to-end.