Model Evaluation for Extreme Risks
First page

Paper summary
DeepMind's framework for evaluating models for catastrophic-risk capabilities.
Ask this paper
01
Dangerous-capability evaluation: Argues for evaluations targeting specifically dangerous capabilities (cyberattacks, bioweapons, manipulation) rather than general performance.
02
Responsible decisions: Connects evaluation results to decisions about training, deployment, access control, and security investments.
03
Red-team integration: Builds on dangerous-capability red-teaming methodology, formalizing it for frontier model governance.
04
Governance influence: Directly informed the UK AI Safety Institute's frontier model evaluation framework and similar efforts.