NVIDIA apresenta o kumo tabular: modelos tabulares de código aberto para análise preditiva eficiente
A NVIDIA introduziu o Kumo Tabular, uma família de modelos tabulares de fundação (TFM) de código aberto, projetada para tarefas de classificação e regressão. Estes modelos preveem novas linhas numa única passagem direta, sem a necessidade de treino, ajuste de hiperparâmetros ou engenharia de características. Disponível nas versões Pequena, Média e Grande, o Kumo Tabular varia de 28 milhões a 215 milhões de parâmetros e funciona através da biblioteca de modelos de dados estruturados (SDM) da NVIDIA. A biblioteca também inclui o TabICLv2, o TabFM do Google e o KumoRelational para dados multi-tabelas. Todos os modelos partilham uma interface de aprendizagem no contexto, construída numa estrutura TableTensor, que suporta a pré-processamento, a combinação e a previsão multi-classe.
O Kumo Tabular, um modelo baseado em Transformer, utiliza mecanismos de atenção de coluna, linha e no contexto. Escala a atenção de consulta com um parâmetro de temperatura que cresce logaritmicamente com o número de chaves, mantendo uma atenção nítida em tabelas maiores. Pré-treinados em tabelas sintéticas geradas a partir de Modelos Causa-Efeito (SCM), os modelos incorporam padrões do mundo real, como valores ausentes e linhas conflitantes. A NVIDIA relata que o Kumo Tabular ocupa o primeiro lugar no TabArena com uma pontuação Elo de 1950 e funciona 17 vezes mais rápido que o LimiX-2 num RTX 6000 Pro. Os modelos estão disponíveis sob licenças permissivas, tornando-os acessíveis para uso comercial.