Arcadia AI — magistratura
UZ
Dastur  /  4-semestr — Thesis & Production
Kurs

AI Safety, Reliability va Security

AI tizimlarining ishonchliligi, xavfsizligi va alignment'i muhandislik intizomi sifatida

O'qituvchi aniqlanmoqda

Kurs haqida

Kurs AI Safety'ni muhandislik va tadqiqot vazifasi sifatida ko'rib chiqadi: adversarial robustness va jailbreak-hujumlarning texnik jihatlaridan tortib, alignment va governance'ning tizimli masalalarigacha. Ham himoya texnikalari (red teaming, constitutional AI, interpretability), ham regulyator framework'lar (EU AI Act, NIST AI RMF) o'rganiladi. Kurs AI tizimlarini mas'uliyatli deploy qilishga tayyorlaydi va karyeraning istalgan yo'nalishi uchun dolzarb.

Nimalarni o'rganasiz

LLM-tizimining red team assessment'ini o'tkazish va topilgan zaifliklarni hujjatlashtirish
ML-pipeline'ga miqdoriy kafolatlar bilan differensial maxfiylikni qo'llash
AI tizimini EU AI Act va NIST AI RMF talablariga muvofiqligini baholash
Adversarial attack'lardan asosiy himoyani (adversarial training yoki certified defense) amalga oshirish

Asosiy mavzular

Adversarial examples: hujumlar (FGSM, PGD, AutoAttack) va himoyalar (adversarial training, certified defenses)
Prompt injection, LLM'ni jailbreaking qilish: mexanizmlar va mitigation
Alignment: RLHF, Constitutional AI, scalable oversight
Interpretability va mechanistic interpretability: circuits, features
AI tizimlarini red teaming qilish: metodologiya va vositalar
ML'da Privacy: differensial maxfiylik (DP), federated learning, membership inference
Regulyator framework'lar: EU AI Act, NIST AI RMF, ISO/IEC 42001
ML'ga supply chain attack'lar: data poisoning, model poisoning
AI governance va model cards, system cards
Ushbu tavsif avtomatik tarzda yaratilgan va hali o'qituvchi tomonidan tekshirilmagan — bu muhokama uchun qoralama.