Novos Desenvolvimentos

Superwhisper apresenta o s1-mini: normalizador de texto de pesos abertos para saída de transcrição limpa

SuperwhisperFonte: MarkTechPost21/08/2026, 07:57
A Superwhisper, uma empresa especializada em tecnologias de transcrição de voz para texto e normalização de texto, lançou o S1-mini, um normalizador de texto de pesos abertos, projetado para transformar transcrições brutas de reconhecimento automático de voz (ASR) em texto escrito polido. O modelo, disponível no Hugging Face sob uma licença Apache 2.0 com uma cláusula de nomeação, funciona como um normalizador de texto, em vez de um modelo de transcrição ou de chat. Está destinado a ser usado após sistemas de ASR, como Whisper ou Parakeet, para refinar transcrições brutas, removendo palavras de preenchimento, resolvendo auto-correções, aplicando pontuação e capitalização, e convertendo números, datas e endereços de e-mail falados em formato escrito. O S1-mini é ajustado a partir de Qwen/Qwen3-0.6B e possui 596 milhões de parâmetros únicos, com 28 camadas e suporte para GQA. O modelo está limitado ao inglês na sua primeira versão e requer um prompt de sistema fixo, uma linha de controlo e uma transcrição bruta para entrada. Ele suporta quatro opções de estilo, dois formatos estruturais e dois conjuntos de configurações contextuais, com todas as combinações treinadas. A Superwhisper relata uma precisão de tokens de 94,8% em um conjunto de teste de 7.519 casos, com uma taxa de erro de edição de texto de 11,6%. O modelo também funciona bem na formatação de e-mails, identificando linhas de saudação 99,3% das vezes e despedidas 97,9% das vezes. Ele corresponde à estrutura de saída correta 97,6% das vezes e gera endereços de e-mail exatos em 92% dos casos. O modelo está limitado na sua funcionalidade, pois não adiciona conteúdo, corrige fatos ou reescreve dialetos. Também retorna uma string vazia para entradas apenas com preenchimento. O S1-mini requer configurações específicas, incluindo a desativação do modo de pensamento e a decodificação gananciosa, para garantir um desempenho ideal. O modelo faz parte da família S1, que inclui o S1-Voice, um modelo de transcrição de voz baseado na nuvem, e o S1-Language, um modelo de acompanhamento de instruções para limpeza e formatação. O S1-Voice atinge velocidades de transcrição até 46 vezes mais rápidas do que o tempo de fala, com uma taxa de erro de palavras de 6,8% em oito conjuntos de dados, incluindo o LibriSpeech, onde cai para 2,2%. O S1-Language está disponível junto com modelos da Anthropic, OpenAI e Groq no seletor de modelos. A Superwhisper também destaca a importância de usar o formato e a configuração de entrada corretos para evitar a degradação ou a confusão da saída. A empresa incentiva os utilizadores a explorar os pesos do modelo e os detalhes técnicos para obter mais informações.
Superwhisper apresenta o s1-mini: normalizador de texto de pesos abertos para saída de transcrição limpa — lupAI