Superwhisper presenta s1-mini: normalizador de texto de código abierto para una salida de reconocimiento de voz limpia
Superwhisper, una empresa especializada en tecnologías de transcripción de voz a texto y normalización de texto, ha lanzado S1-mini, un normalizador de texto de código abierto diseñado para transformar transcripciones de reconocimiento automático de voz (ASR) sin procesar en texto escrito pulido.
El modelo, disponible en Hugging Face bajo una licencia Apache 2.0 con una cláusula de nomenclatura, funciona como un normalizador de texto en lugar de un modelo de transcripción o de chat.
Está destinado a utilizarse después de los sistemas de ASR, como Whisper o Parakeet, para refinar las transcripciones sin procesar eliminando las palabras de relleno, corrigiendo las autocrificaciones, aplicando puntuación y capitalización, y convirtiendo los números, fechas y direcciones de correo electrónico hablados en formato escrito.
S1-mini se ha afinado a partir de Qwen/Qwen3-0.6B y tiene 596 millones de parámetros únicos, con 28 capas y soporte para GQA. El modelo está limitado al inglés en su primera versión y requiere una instrucción del sistema fija, una línea de control y una transcripción sin procesar para la entrada.
Soporta cuatro opciones de estilo, dos formatos estructurales y dos configuraciones contextuales, con todas las combinaciones entrenadas. Superwhisper informa de una precisión de tokens del 94,8 % en un conjunto de prueba de 7.519 casos, con una tasa de error de edición de texto del 11,6 %.
El modelo también funciona bien en el formato de correo electrónico, identificando líneas de saludo en un 99,3 % de los casos y despedidas en un 97,9 % de los casos. Coincide con la estructura de salida correcta en un 97,6 % de los casos y genera direcciones de correo electrónico exactas en un 92 % de los casos. El modelo está limitado en su funcionalidad, ya que no añade contenido, corrige hechos ni reescribe dialectos.
También devuelve una cadena vacía para la entrada de relleno únicamente. S1-mini requiere configuraciones específicas, incluida la desactivación del modo de pensamiento y la decodificación codiciosa, para garantizar un rendimiento óptimo.
El modelo forma parte de la familia S1, que incluye S1-Voice, un modelo de transcripción de voz basado en la nube, y S1-Language, un modelo de seguimiento de instrucciones para la limpieza y el formato.
S1-Voice consigue velocidades de transcripción hasta 46 veces más rápidas que el tiempo de habla, con una tasa de error de palabras del 6,8 % en ocho conjuntos de datos, incluidos LibriSpeech, donde baja al 2,2 %. S1-Language está disponible junto con los modelos de Anthropic, OpenAI y Groq en el selector de modelos.
Superwhisper también destaca la importancia de utilizar el formato de entrada y la configuración correctos para evitar la degradación o la distorsión de la salida. La empresa anima a los usuarios a explorar los pesos del modelo y los detalles técnicos para obtener más información.