Arcadia AI — magistratura
UZ
Dastur  /  3-semestr — Specialization & Research
Kurs

ML Engineering: GPU, LLM serving, kompressiya, distributed training

Yuqori unumdor ML-tizimlar: GPU, distributed training, kompressiya va LLM serving

O'qituvchi aniqlanmoqda

Kurs haqida

Kurs sanoat miqyosidagi modellarni o'qitish va deploy qilish uchun zarur bo'lgan tizim muhandisligini qamrab oladi. GPU arxitekturasi, CUDA-yadrolarini optimallashtirish, distributed training texnikalari (data/model/pipeline parallelism), model kompressiyasi va yuqori unumdor LLM inference tizimlari o'rganiladi. Kurs Amaliyot 3 jamoasining muvaffaqiyatini bevosita ta'minlaydi va samarali arxitekturalar bo'yicha research-mavzular uchun kirish hisoblanadi.

Nimalarni o'rganasiz

CUDA-yadrolarini profillash va GPU hisoblashlaridagi bottleneck'larni bartaraf etish
1B dan ortiq parametrli model uchun FSDP yoki tensor parallelism yordamida distributed training amalga oshirish
PTQ kvantizatsiyasini qo'llash va vazifada sifat degradatsiyasini o'lchash
Maqsadli latency'ga erishish uchun continuous batching va KV-cache bilan LLM serving tizimini sozlash

Asosiy mavzular

GPU arxitekturasi: SIMT, warp, shared memory, memory coalescing
CUDA programming: kernels, streams, profillash (Nsight)
Aralash aniqlik (mixed precision): FP16, BF16, FP8, loss scaling
Distributed training: DDP, FSDP, tensor/pipeline parallelism
Transformerlarni optimallashtirish: FlashAttention, KV-cache, continuous batching
Kvantizatsiya: post-training (PTQ), quantization-aware training (QAT)
Pruning: structured/unstructured, magnitude va gradient-based
Knowledge distillation: response-based, feature-based
LLM serving: vLLM, TensorRT-LLM, speculative decoding
Ushbu tavsif avtomatik tarzda yaratilgan va hali o'qituvchi tomonidan tekshirilmagan — bu muhokama uchun qoralama.