🚀NEW LABGetting Started with Claude AgentsStart lab
Evaluation

Model Evaluation for Extreme Risks

First page
Model Evaluation for Extreme Risks
Paper summary

DeepMind's framework for evaluating models for catastrophic-risk capabilities.

Ask this paper

Key points
01

Dangerous-capability evaluation: Argues for evaluations targeting specifically dangerous capabilities (cyberattacks, bioweapons, manipulation) rather than general performance.

02

Responsible decisions: Connects evaluation results to decisions about training, deployment, access control, and security investments.

03

Red-team integration: Builds on dangerous-capability red-teaming methodology, formalizing it for frontier model governance.

04

Governance influence: Directly informed the UK AI Safety Institute's frontier model evaluation framework and similar efforts.

Every Monday
Get next week’s papers.
Subscribe on Substack