
Обнаружение атак с задними дверями в языковых моделях
Атаки с задними дверями внедряют скрытые вредоносные триггеры в ИИ и языковые модели и трудно поддаются обнаружению и нейтрализации. В статье рассмотрены угрозы, методы обнаружения и стратегии защиты и исследований.









