Hochperformante ML-Systeme: GPU, verteiltes Training, Kompression und LLM Serving
Der Kurs behandelt die Systemtechnik, die für Training und Deployment von Modellen im industriellen Maßstab erforderlich ist. Behandelt werden GPU-Architektur, die Optimierung von CUDA-Kernels, Techniken des verteilten Trainings (Data/Model/Pipeline Parallelism), Modellkompression sowie hochperformante Inferenzsysteme für LLMs. Der Kurs bildet die direkte Grundlage für den Erfolg im Team-Praktikum 3 und ist Eingangsvoraussetzung für Forschungsthemen zu effizienten Architekturen.