Arcadia AI — मास्टर्स प्रोग्राम
HI
प्रोग्राम  /  सेमेस्टर 3 — Specialization & Research
कोर्स

Multimodal: Computer Vision या Audio/Speech में से चुनें

मल्टीमॉडल AI: स्टूडेंट की पसंद के अनुसार कंप्यूटर विज़न या ऑडियो/स्पीच प्रोसेसिंग

फ़ैकल्टी की पुष्टि होना बाकी है

कोर्स के बारे में

यह कोर्स मल्टीमॉडल AI की दो दिशाओं में से किसी एक में स्पेशलाइज़ेशन को गहरा करता है: Computer Vision (डिटेक्शन, सेगमेंटेशन, vision-language मॉडल) या Audio/Speech (ASR, TTS, speaker diarization, मल्टीमॉडल ऑडियो मॉडल)। इसमें उस मॉडैलिटी के लिए विशिष्ट आर्किटेक्चरल समाधानों के साथ-साथ multimodal fusion के सामान्य दृष्टिकोणों का भी अध्ययन किया जाता है। यह कोर्स रिसर्च ट्रैक (s3-ai-research) और एप्लाइड प्रोजेक्ट्स (s3-applied-ai) के लिए तैयार करता है।

आप क्या सीखेंगे

किसी वास्तविक डेटासेट पर एक विशेष मल्टीमॉडल आर्किटेक्चर बनाना और उसे फाइन-ट्यून करना
लेबलिंग की आवश्यकता कम करने के लिए self-supervised pretraining लागू करना
मॉडैलिटीज़ को एक एकीकृत सिस्टम में जोड़ने के लिए fusion-मैकेनिज़्म को क्रियान्वित करना
मॉडैलिटी-विशिष्ट मेट्रिक्स (mAP, WER, FID आदि) के आधार पर गुणवत्ता का मूल्यांकन करना

मुख्य विषय

इमेज/ऑडियो प्रोसेसिंग की विशिष्टताएँ: स्थानिक और कालिक संरचनाएँ
Backbone आर्किटेक्चर: ResNet, ViT, EfficientNet (CV) / wav2vec, Whisper (Audio)
ऑब्जेक्ट डिटेक्शन (YOLO, DETR) या end-to-end ASR सिस्टम
सेगमेंटेशन (Mask R-CNN, SAM) या TTS (FastSpeech, VITS)
Vision-Language मॉडल: CLIP, BLIP, LLaVA / Audio-Language: AudioLM, AudioPaLM
Multimodal fusion: early, late, cross-attention
संबंधित मॉडैलिटी में self-supervised प्रशिक्षण
CV/Audio के लिए ऑग्मेंटेशन और domain adaptation
मॉडैलिटी के बेंचमार्क और मूल्यांकन मेट्रिक्स
यह विवरण स्वतः जनरेट किया गया है और अभी तक किसी फ़ैकल्टी सदस्य द्वारा जाँचा नहीं गया है — यह चर्चा हेतु एक ड्राफ़्ट है।