मल्टीमॉडल AI: स्टूडेंट की पसंद के अनुसार कंप्यूटर विज़न या ऑडियो/स्पीच प्रोसेसिंग
यह कोर्स मल्टीमॉडल AI की दो दिशाओं में से किसी एक में स्पेशलाइज़ेशन को गहरा करता है: Computer Vision (डिटेक्शन, सेगमेंटेशन, vision-language मॉडल) या Audio/Speech (ASR, TTS, speaker diarization, मल्टीमॉडल ऑडियो मॉडल)। इसमें उस मॉडैलिटी के लिए विशिष्ट आर्किटेक्चरल समाधानों के साथ-साथ multimodal fusion के सामान्य दृष्टिकोणों का भी अध्ययन किया जाता है। यह कोर्स रिसर्च ट्रैक (s3-ai-research) और एप्लाइड प्रोजेक्ट्स (s3-applied-ai) के लिए तैयार करता है।