🚀NEW LABGetting Started with Claude AgentsStart lab
Evaluation · Agents

Evaluating Persona Agents

First page
Evaluating Persona Agents
Paper summary

proposes a benchmark to evaluate persona agent capabilities in LLMs; finds that Claude 3.5 Sonnet only has a 2.97% relative improvement in PersonaScore compared to GPT 3.5 despite being a much more advanced model.

Ask this paper

Every Monday
Get next week’s papers.
Subscribe on Substack