Arcadia AI – Master-Studiengang
DE
Studiengang  /  Semester 3 – Specialization & Research
Kurs

Multimodal: Computer Vision oder Audio/Speech nach Wahl

Multimodaler AI: Computer Vision oder Audio-/Sprachverarbeitung nach Wahl der Studierenden

Lehrperson wird noch bekannt gegeben

Über den Kurs

Der Kurs vertieft die Spezialisierung in einer der multimodalen Richtungen: Computer Vision (Detektion, Segmentierung, Vision-Language-Modelle) oder Audio/Speech (ASR, TTS, Speaker Diarization, multimodale Audiomodelle). Behandelt werden sowohl modalitätsspezifische Architekturlösungen als auch allgemeine Ansätze zur Multimodal Fusion. Der Kurs bereitet auf den Forschungstrack (s3-ai-research) und auf angewandte Projekte (s3-applied-ai) vor.

Was Sie lernen

Eine spezialisierte multimodale Architektur auf einem realen Datensatz aufbauen und feinabstimmen
Self-Supervised Pretraining anwenden, um den Bedarf an Annotationen zu reduzieren
Einen Fusion-Mechanismus implementieren, um Modalitäten zu einem einheitlichen System zu verbinden
Die Qualität mithilfe modalitätsspezifischer Metriken bewerten (mAP, WER, FID u. a.)

Kernthemen

Besonderheiten der Bild-/Audioverarbeitung: räumliche und zeitliche Strukturen
Backbone-Architekturen: ResNet, ViT, EfficientNet (CV) / wav2vec, Whisper (Audio)
Objektdetektion (YOLO, DETR) oder End-to-End-ASR-Systeme
Segmentierung (Mask R-CNN, SAM) oder TTS (FastSpeech, VITS)
Vision-Language-Modelle: CLIP, BLIP, LLaVA / Audio-Language: AudioLM, AudioPaLM
Multimodal Fusion: Early, Late, Cross-Attention
Self-Supervised Learning in der jeweiligen Modalität
Augmentierungen und Domain Adaptation für CV/Audio
Benchmarks und Bewertungsmetriken der Modalität
Die Beschreibung wurde automatisch generiert und wurde noch nicht von der Lehrperson geprüft – dies ist ein Entwurf zur Diskussion.