Visokoperformansni ML sistemi: GPU, distribuirano obučavanje, kompresija i LLM serving
Kurs obuhvata sistemsko inženjerstvo neophodno za obučavanje i deploy modela industrijskih razmera. Izučava se arhitektura GPU-a, optimizacija CUDA jezgara, tehnike distribuiranog obučavanja (data/model/pipeline parallelism), kompresija modela i sistemi visokoperformansne LLM inferencije. Kurs direktno obezbeđuje uspeh tima u Praksi 3 i predstavlja uvod u research teme o efikasnim arhitekturama.