Novo curso: Aplicações LLM ultrarrápidas com hardware especializado
Lancou-se um novo curso focado em construir aplicações de linguagem com tempos de resposta otimizados, desenvolvido em colaboração com a Cerebras e ministrado por especialistas da área.
O desempenho rápido em inferência é crítico em muitos cenários. A maioria do tempo usado pelos modelos ocorre ao mover pesos entre a memória e as unidades de processamento. Hardware especializado minimiza este gargalo, permitindo gerar tokens várias vezes mais rápido do que em configurações tradicionais com GPUs.
Os participantes aprenderão a comparar diferentes arquiteturas de hardware e avaliar suas estratégias para reduzir latência. O programa inclui projectos práticos em aplicações sensíveis ao tempo: personalização dinâmica de interfaces, análise de mercado em tempo real e deployement de tradução e voz em direto. Também cobre padrões de programação eficiente para agentes de IA, com ênfase em velocidade e responsividade.