Misinformation attacks test whether a model will generate or validate false information. Unlike disinformation (which is deliberate), misinformation attacks exploit model tendencies toward sycophancy, confabulation, and false confidence. These tests check if models admit uncertainty, resist false premises, and avoid fabricating citations or statistics.

Summary

8 attacks total: 6 single-turn, 2 multi-turn.

Attacks

Example