Arcadia AI – Master-Studiengang
DE
Studiengang  /  Semester 4 – Thesis & Production
Kurs

AI Safety, Reliability und Security

Zuverlässigkeit, Sicherheit und Alignment von AI-Systemen als ingenieurwissenschaftliche Disziplin

Lehrperson wird noch bekannt gegeben

Über den Kurs

Der Kurs behandelt AI Safety als ingenieurwissenschaftliche und forschungsbezogene Aufgabe: von den technischen Aspekten der Adversarial Robustness und Jailbreak-Angriffe bis zu den systemischen Fragen von Alignment und Governance. Behandelt werden sowohl defensive Techniken (Red Teaming, Constitutional AI, Interpretability) als auch regulatorische Rahmenwerke (EU AI Act, NIST AI RMF). Der Kurs bereitet auf den verantwortungsvollen Einsatz von AI-Systemen vor und ist für jeden Karriereweg relevant.

Was Sie lernen

Ein Red-Team-Assessment eines LLM-Systems durchführen und gefundene Schwachstellen dokumentieren
Differential Privacy mit quantifizierbaren Garantien auf eine ML-Pipeline anwenden
Ein AI-System auf Konformität mit den Anforderungen des EU AI Act und des NIST AI RMF bewerten
Einen grundlegenden Schutz vor Adversarial Attacks implementieren (Adversarial Training oder Certified Defense)

Kernthemen

Adversarial Examples: Angriffe (FGSM, PGD, AutoAttack) und Abwehrmaßnahmen (Adversarial Training, Certified Defenses)
Prompt Injection, Jailbreaking von LLMs: Mechanismen und Mitigation
Alignment: RLHF, Constitutional AI, Scalable Oversight
Interpretability und Mechanistic Interpretability: Circuits, Features
Red Teaming von AI-Systemen: Methodik und Werkzeuge
Privacy in ML: Differential Privacy (DP), Federated Learning, Membership Inference
Regulatorische Rahmenwerke: EU AI Act, NIST AI RMF, ISO/IEC 42001
Supply-Chain-Angriffe auf ML: Data Poisoning, Model Poisoning
AI Governance sowie Model Cards, System Cards
Die Beschreibung wurde automatisch generiert und wurde noch nicht von der Lehrperson geprüft – dies ist ein Entwurf zur Diskussion.