Пользователь хочет понять content moderation / safety filters в контексте LLM Security и применить это к практической работе по AI governance или комплаенсу.
Content moderation и safety filters — это controls, предназначенные для обнаружения, блокировки, снижения или эскалации вредного, незаконного или запрещенного политикой контента. В AI-системах они часто сочетаются с policy rules, model-based classifiers, логированием и human review для более рискованных случаев.
Материал в разработке
Этот ответ сейчас готовится. Загляните позже за полной версией.