Arcadia AI – Master-Studiengang
DE
Studiengang  /  Semester 3 — Specialization & Research
Kurs

ML Engineering: GPU, LLM Serving, Kompression, Distributed Training

Hochperformante ML-Systeme: GPU, verteiltes Training, Kompression und LLM Serving

Lehrperson wird noch bekannt gegeben

Über den Kurs

Der Kurs behandelt die Systemtechnik, die für Training und Deployment von Modellen im industriellen Maßstab erforderlich ist. Behandelt werden GPU-Architektur, die Optimierung von CUDA-Kernels, Techniken des verteilten Trainings (Data/Model/Pipeline Parallelism), Modellkompression sowie hochperformante Inferenzsysteme für LLMs. Der Kurs bildet die direkte Grundlage für den Erfolg im Team-Praktikum 3 und ist Eingangsvoraussetzung für Forschungsthemen zu effizienten Architekturen.

Was Sie lernen

CUDA-Kernels profilen und Bottlenecks bei GPU-Berechnungen beseitigen
Verteiltes Training mit FSDP oder Tensor Parallelism für Modelle >1B Parameter umsetzen
PTQ-Quantisierung anwenden und die Qualitätsdegradation an einer Aufgabe messen
Ein LLM-Serving-System mit Continuous Batching und KV-Cache konfigurieren, um die Ziel-Latenz zu erreichen

Kernthemen

GPU-Architektur: SIMT, Warp, Shared Memory, Memory Coalescing
CUDA Programming: Kernels, Streams, Profiling (Nsight)
Mixed Precision: FP16, BF16, FP8, Loss Scaling
Distributed Training: DDP, FSDP, Tensor/Pipeline Parallelism
Optimierung von Transformern: FlashAttention, KV-Cache, Continuous Batching
Quantisierung: Post-Training (PTQ), Quantization-Aware Training (QAT)
Pruning: structured/unstructured, magnitude- und gradient-based
Knowledge Distillation: response-based, feature-based
LLM Serving: vLLM, TensorRT-LLM, Speculative Decoding
Die Beschreibung wurde automatisch generiert und wurde noch nicht von der Lehrperson geprüft – dies ist ein Entwurf zur Diskussion.