Arcadia AI — master akademske studije
SR
Program  /  Semestar 3 — Specialization & Research
Kurs

ML Engineering: GPU, LLM serving, kompresija, distributed training

Visokoperformansni ML sistemi: GPU, distribuirano obučavanje, kompresija i LLM serving

Predavač se utvrđuje

O kursu

Kurs obuhvata sistemsko inženjerstvo neophodno za obučavanje i deploy modela industrijskih razmera. Izučava se arhitektura GPU-a, optimizacija CUDA jezgara, tehnike distribuiranog obučavanja (data/model/pipeline parallelism), kompresija modela i sistemi visokoperformansne LLM inferencije. Kurs direktno obezbeđuje uspeh tima u Praksi 3 i predstavlja uvod u research teme o efikasnim arhitekturama.

Šta ćete naučiti

Profilisati CUDA jezgra i otklanjati bottleneck-ove u GPU izračunavanjima
Implementirati distribuirano obučavanje sa FSDP ili tensor parallelism za model sa >1B parametara
Primenjivati PTQ kvantizaciju i meriti degradaciju kvaliteta na zadatku
Konfigurisati LLM serving sistem sa continuous batching i KV-cache radi postizanja ciljne latency

Ključne teme

Arhitektura GPU-a: SIMT, warp, shared memory, memory coalescing
CUDA programming: kernels, streams, profilisanje (Nsight)
Mešovita preciznost (mixed precision): FP16, BF16, FP8, loss scaling
Distributed training: DDP, FSDP, tensor/pipeline parallelism
Optimizacija transformera: FlashAttention, KV-cache, continuous batching
Kvantizacija: post-training (PTQ), quantization-aware training (QAT)
Pruning: structured/unstructured, magnitude i gradient-based
Knowledge distillation: response-based, feature-based
LLM serving: vLLM, TensorRT-LLM, speculative decoding
Opis je automatski generisan i predavač ga još nije proverio — ovo je nacrt za diskusiju.