Multimodalna veštačka inteligencija: računarski vid ili obrada audio/govora po izboru studenta
Kurs produbljuje specijalizaciju u jednom od multimodalnih pravaca: Computer Vision (detekcija, segmentacija, vision-language modeli) ili Audio/Speech (ASR, TTS, speaker diarization, multimodalni audio-modeli). Izučavaju se kako arhitekturna rešenja specifična za modalitet, tako i opšti pristupi multimodal fusion. Kurs priprema za istraživački smer (s3-ai-research) i primenjene projekte (s3-applied-ai).