Logo Gota AquatechAquatech IA
Seguridad de IA

Guía didáctica: Moderación y Seguridad de IA

Alineamiento y protección de sistemas conversacionales

🤝

Técnicas de Alineamiento: RLHF

Los modelos base entrenados con texto de internet a menudo generan contenido ofensivo o dañino. Para alinearlos con los valores humanos, se utiliza el Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF):
  1. Evaluadores humanos clasifican múltiples respuestas generadas por el modelo.
  2. Se entrena un modelo de recompensa para predecir las preferencias humanas.
  3. Se optimiza el LLM principal mediante aprendizaje por refuerzo para maximizar la recompensa.
🚨

Pipelines de Filtro y Moderación en Tiempo Real

En producción, se implementan capas de seguridad antes y después del LLM:
  • Clasificadores de Moderación: Modelos pequeños entrenados para detectar categorías específicas de daño (odio, violencia, autolesión, acoso).
  • Filtros de Inyección de Prompts: Detectan intentos del usuario de "engañar" al modelo para saltarse sus directrices de seguridad.