Arcadia AI — master akademske studije
SR
Program  /  Semestar 3 — Specialization & Research
Kurs

Multimodal: Computer Vision ili Audio/Speech po izboru

Multimodalna veštačka inteligencija: računarski vid ili obrada audio/govora po izboru studenta

Predavač se utvrđuje

O kursu

Kurs produbljuje specijalizaciju u jednom od multimodalnih pravaca: Computer Vision (detekcija, segmentacija, vision-language modeli) ili Audio/Speech (ASR, TTS, speaker diarization, multimodalni audio-modeli). Izučavaju se kako arhitekturna rešenja specifična za modalitet, tako i opšti pristupi multimodal fusion. Kurs priprema za istraživački smer (s3-ai-research) i primenjene projekte (s3-applied-ai).

Šta ćete naučiti

Da gradite i dodatno obučavate specijalizovanu multimodalnu arhitekturu na realnom datasetu
Da primenjujete self-supervised pretraining radi smanjenja potrebe za obeležavanjem podataka
Da implementirate fusion-mehanizam za objedinjavanje modaliteta u jedinstven sistem
Da ocenjujete kvalitet primenom modalno-specifičnih metrika (mAP, WER, FID i dr.)

Ključne teme

Specifičnosti obrade slika/audija: prostorne i vremenske strukture
Backbone-arhitekture: ResNet, ViT, EfficientNet (CV) / wav2vec, Whisper (Audio)
Detekcija objekata (YOLO, DETR) ili ASR end-to-end sistemi
Segmentacija (Mask R-CNN, SAM) ili TTS (FastSpeech, VITS)
Vision-Language modeli: CLIP, BLIP, LLaVA / Audio-Language: AudioLM, AudioPaLM
Multimodal fusion: early, late, cross-attention
Self-supervised učenje u konkretnom modalitetu
Augmentacije i domain adaptation za CV/Audio
Benčmarci i evaluacione metrike modaliteta
Opis je automatski generisan i predavač ga još nije proverio — ovo je nacrt za diskusiju.