Multimodaler AI: Computer Vision oder Audio-/Sprachverarbeitung nach Wahl der Studierenden
Der Kurs vertieft die Spezialisierung in einer der multimodalen Richtungen: Computer Vision (Detektion, Segmentierung, Vision-Language-Modelle) oder Audio/Speech (ASR, TTS, Speaker Diarization, multimodale Audiomodelle). Behandelt werden sowohl modalitätsspezifische Architekturlösungen als auch allgemeine Ansätze zur Multimodal Fusion. Der Kurs bereitet auf den Forschungstrack (s3-ai-research) und auf angewandte Projekte (s3-applied-ai) vor.