
Detectando ataques de puerta trasera en modelos de lenguaje
Los ataques de puerta trasera inyectan disparadores maliciosos ocultos en modelos de IA y de lenguaje, siendo difíciles de detectar y mitigar. Esta publicación explora cómo estas amenazas comprometen el aprendizaje automático, técnicas prácticas de detección y recursos para defensa e investigación.









