El usuario quiere entender la moderación de contenido y los filtros de seguridad en el contexto de la seguridad de LLM y aplicarlos a trabajos prácticos de gobernanza o cumplimiento en IA.
La moderación de contenido y los filtros de seguridad son controles diseñados para detectar, bloquear, reducir o escalar contenido dañino, ilegal o no permitido por las políticas. En los sistemas de IA, suelen combinarse con reglas de política, clasificadores basados en modelos, registros y revisión humana para casos de mayor riesgo.
Contenido en progreso
Esta respuesta se está redactando. Vuelve pronto para ver la guía completa.