AIR-ML
Home
Research
News
Team
Project
Publication
Contact
1
GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis
GREAT exposes a realistic RLHF vulnerability by targeting a semantic trigger distribution and using latent-space medoid selection to implant distributional backdoors that generalize to unseen triggers while preserving utility and evading defenses.
Subrat Kishore Dutta
,
Yuelin Xu
,
Piyush Pant
,
Xiao Zhang
PDF
Cite
Code
ArXiv
Cite
×