Arcadia AI — मास्टर्स प्रोग्राम
HI
प्रोग्राम  /  सेमेस्टर 3 — Specialization & Research
कोर्स

ML Engineering: GPU, LLM serving, कंप्रेशन, distributed training

उच्च-प्रदर्शन ML सिस्टम्स: GPU, distributed training, कंप्रेशन और LLM serving

फ़ैकल्टी की पुष्टि होना बाकी है

कोर्स के बारे में

यह कोर्स औद्योगिक स्तर के मॉडल्स के ट्रेनिंग और डिप्लॉयमेंट के लिए आवश्यक सिस्टम्स इंजीनियरिंग को कवर करता है। इसमें GPU आर्किटेक्चर, CUDA kernels के ऑप्टिमाइज़ेशन, distributed training की तकनीकें (data/model/pipeline parallelism), मॉडल कंप्रेशन, और उच्च-प्रदर्शन LLM inference सिस्टम्स का अध्ययन किया जाता है। यह कोर्स प्रैक्टिकम 3 में टीम की सफलता के लिए सीधे तौर पर आधार तैयार करता है और कुशल आर्किटेक्चर पर research विषयों के लिए प्रवेश-बिंदु है।

आप क्या सीखेंगे

CUDA kernels को प्रोफ़ाइल करना और GPU कंप्यूटेशन में bottleneck दूर करना
>1B पैरामीटर वाले मॉडल के लिए FSDP या tensor parallelism से distributed training लागू करना
PTQ quantization लागू करना और किसी टास्क पर क्वालिटी की गिरावट मापना
लक्षित latency हासिल करने के लिए continuous batching और KV-cache के साथ LLM serving सिस्टम सेट करना

मुख्य विषय

GPU आर्किटेक्चर: SIMT, warp, shared memory, memory coalescing
CUDA programming: kernels, streams, प्रोफ़ाइलिंग (Nsight)
Mixed precision: FP16, BF16, FP8, loss scaling
Distributed training: DDP, FSDP, tensor/pipeline parallelism
Transformers का ऑप्टिमाइज़ेशन: FlashAttention, KV-cache, continuous batching
Quantization: post-training (PTQ), quantization-aware training (QAT)
Pruning: structured/unstructured, magnitude और gradient-based
Knowledge distillation: response-based, feature-based
LLM serving: vLLM, TensorRT-LLM, speculative decoding
यह विवरण स्वतः जनरेट किया गया है और अभी तक किसी फ़ैकल्टी सदस्य द्वारा जाँचा नहीं गया है — यह चर्चा हेतु एक ड्राफ़्ट है।