Context manipulation attacks use multi-turn conversations to gradually steer a model toward harmful outputs. Techniques include crescendo escalation, Socratic questioning chains, sunk cost exploitation, and narrative misdirection. These attacks work because safety evaluation often focuses on individual turns rather than the trajectory of a full conversation.

Summary

9 attacks total: 9 multi-turn.

Attacks

Example