Also known as: Content Moderation and Safety Filters · Content Moderation Safety Filters
Content Moderation und Safety Filters sind Kontrollen, die schädliche, illegale oder richtlinienwidrige Inhalte erkennen, blockieren, reduzieren oder eskalieren sollen. In KI-Systemen werden sie häufig mit Richtlinienregeln, modellbasierten Klassifikatoren, Protokollierung und menschlicher Prüfung für Fälle mit höherem Risiko kombiniert.
Controls that reduce harmful or disallowed outputs (e.g., hate speech, self-harm). Often combined with human review for higher-risk contexts.