AI/ML

AI Safety

Definition

AI Safety umfasst Forschung und Massnahmen, um sicherzustellen, dass KI-Systeme nicht schaedlich werden. Dazu gehoeren Alignment, Robustheit gegen adversariale Angriffe, Ueberwachung von Modellausgaben und Verhinderung von Missbrauch. AI Safety gewinnt mit staerkeren Modellen an Bedeutung.

Beispiel

Red-Teaming testen ein LLM mit gezielten Angriffen, um sicherzustellen, dass es keine schaedlichen Anleitungen ausgibt.