Tutoriais & Guias

Novo curso ensina técnicas eficientes para servir modelos de linguagem em produção

Red Hat + vLLMFonte: Andrew Ng (X)04/06/2026, 13:44
Um curso focado em implementação eficiente de Large Language Models foi lançado em parceria com a Red Hat, ministrado por Cedric Clyburn. O programa aborda os desafios práticos de colocar modelos em produção, particularmente a gestão de memória GPU. Um modelo com 70 mil milhões de parâmetros requer aproximadamente 140 GB apenas para carregar os pesos, enquanto cada requisição ativa necessita de espaço adicional para armazenar o contexto (KV cache). O curso ensina quantização para reduzir a pegada de memória e utiliza o vLLM, uma ferramenta otimizada para gerir múltiplos pedidos simultâneos. Os participantes aprendem a quantizar modelos, avaliar compromissos de precisão, implementar com vLLM e fazer benchmarks das suas implementações.
Novo curso ensina técnicas eficientes para servir modelos de linguagem em produção — lupAI