Also known as: Content Moderation and Safety Filters · Content Moderation Safety Filters
La moderación de contenido y los filtros de seguridad son controles diseñados para detectar, bloquear, reducir o escalar contenido dañino, ilegal o no permitido por políticas. En sistemas de IA, a menudo se combinan con reglas de política, clasificadores basados en modelos, registro y revisión humana para casos de mayor riesgo.
Controls that reduce harmful or disallowed outputs (e.g., hate speech, self-harm). Often combined with human review for higher-risk contexts.