Arcadia AI — master akademske studije
SR
Program  /  Semestar 4 — Thesis & Production
Kurs

AI Safety, Reliability i Security

Pouzdanost, bezbednost i usklađivanje (alignment) AI sistema kao inženjerska disciplina

Predavač se utvrđuje

O kursu

Kurs razmatra AI Safety kao inženjerski i istraživački zadatak: od tehničkih aspekata adversarial robustness i jailbreak napada do sistemskih pitanja alignmenta i governance-a. Izučavaju se i odbrambene tehnike (red teaming, constitutional AI, interpretability), i regulatorni okviri (EU AI Act, NIST AI RMF). Kurs priprema za odgovoran deploy AI sistema i relevantan je za svaki karijerni pravac.

Šta ćete naučiti

Sprovesti red team assessment LLM sistema i dokumentovati pronađene ranjivosti
Primeniti diferencijalnu privatnost na ML pipeline sa kvantitativnim garancijama
Oceniti AI sistem u pogledu usklađenosti sa zahtevima EU AI Act i NIST AI RMF
Implementirati osnovnu zaštitu od adversarial attacks (adversarial training ili certified defense)

Ključne teme

Adversarial examples: napadi (FGSM, PGD, AutoAttack) i odbrane (adversarial training, certified defenses)
Prompt injection, jailbreaking LLM-a: mehanizmi i mitigacija
Alignment: RLHF, Constitutional AI, scalable oversight
Interpretability i mechanistic interpretability: circuits, features
Red teaming AI sistema: metodologija i alati
Privacy u ML-u: diferencijalna privatnost (DP), federated learning, membership inference
Regulatorni okviri: EU AI Act, NIST AI RMF, ISO/IEC 42001
Supply chain attacks na ML: data poisoning, model poisoning
AI governance i model cards, system cards
Opis je automatski generisan i predavač ga još nije proverio — ovo je nacrt za diskusiju.