Arcadia AI — magistratura
UZ
Dastur  /  3-semestr — Specialization & Research
Kurs

Multimodal: tanlov bo'yicha Computer Vision yoki Audio/Speech

Multimodal AI: talaba tanloviga ko'ra Computer Vision yoki audio/nutqni qayta ishlash

O'qituvchi aniqlanmoqda

Kurs haqida

Kurs multimodal yo'nalishlardan birida ixtisoslashuvni chuqurlashtiradi: Computer Vision (detektsiya, segmentatsiya, vision-language modellar) yoki Audio/Speech (ASR, TTS, speaker diarization, multimodal audio modellar). Modalitaga xos arxitektura yechimlari, shuningdek umumiy multimodal fusion yondashuvlari o'rganiladi. Kurs ilmiy-tadqiqot yo'nalishiga (s3-ai-research) va amaliy loyihalarga (s3-applied-ai) tayyorlaydi.

Nimalarni o'rganasiz

Real datasetda ixtisoslashgan multimodal arxitekturani qurish va fine-tuning qilish
Annotatsiyaga bo'lgan ehtiyojni kamaytirish uchun self-supervised pretraining qo'llash
Modalitalarni yagona tizimga birlashtirish uchun fusion mexanizmini amalga oshirish
Modalitaga xos metrikalar (mAP, WER, FID va boshqalar) yordamida sifatni baholash

Asosiy mavzular

Tasvir/audioni qayta ishlash xususiyatlari: fazoviy va vaqtli strukturalar
Backbone arxitekturalar: ResNet, ViT, EfficientNet (CV) / wav2vec, Whisper (Audio)
Obyektlarni detektsiya qilish (YOLO, DETR) yoki end-to-end ASR tizimlari
Segmentatsiya (Mask R-CNN, SAM) yoki TTS (FastSpeech, VITS)
Vision-Language modellar: CLIP, BLIP, LLaVA / Audio-Language: AudioLM, AudioPaLM
Multimodal fusion: early, late, cross-attention
Muayyan modalitada self-supervised o'qitish
CV/Audio uchun augmentatsiyalar va domain adaptation
Modalitaning benchmarklari va baholash metrikalari
Ushbu tavsif avtomatik tarzda yaratilgan va hali o'qituvchi tomonidan tekshirilmagan — bu muhokama uchun qoralama.