Research agenda
Model Persona Research Agenda
This agenda studies and steers the emergence of malicious propensities in LLMs — traits like spitefulness, sadism, and punitiveness. We treat personas, bundles of correlated traits, as a useful abstraction for how propensities generalise out-of-distribution, and as a target for interventions.
Selected work
- Inoculation Adapters Improve Upon Inoculation Prompting
- Concrete Research Ideas on AI Personas
- Conditionalization Confounds Inoculation Prompting Results
- Strategic Obfuscation of Deceptive Reasoning in Language Models
- Training large language models on narrow tasks can lead to broad misalignment
- Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs