🚀NEW LABGetting Started with Claude AgentsStart lab
Evaluation · Agents · Code

SWE-PolyBench

First page
SWE-PolyBench
Paper summary

SWE-PolyBench is a new multi-language benchmark for evaluating coding agents on real-world software tasks across Java, JavaScript, TypeScript, and Python. It introduces execution-based assessments, syntax tree metrics, and reveals that current agents struggle with complex tasks and show inconsistent performance across languages.

Ask this paper

Every Monday
Get next week’s papers.
Subscribe on Substack