🚀NEW LABGetting Started with Claude AgentsStart lab
DAIR.AI · Curated weekly since April 2023

AI Papers of the Week

Every paper worth reading in AI, hand-picked one week at a time.

2,650
Papers
182
Weekly issues
2023
Since

Discover and explore top AI papers with Claude Code or Codex

npx @dair-ai/mcp setup
546 papers · EvaluationClear filters →
Benchmarking NN Training Algorithms (AlgoPerf)

Benchmarking NN Training Algorithms (AlgoPerf)

A new benchmark for rigorously evaluating optimizers using realistic workloads.

529Evaluation
Mind2Web

Mind2Web

A dataset for evaluating generalist web agents with 2,350 tasks across 137 websites and 31 domains.

530Agents
Humor in ChatGPT

Humor in ChatGPT

Explores ChatGPT's capabilities to grasp and reproduce humor.

531Evaluation
BiomedGPT

BiomedGPT

A unified biomedical GPT for vision, language, and multimodal tasks.

532Multimodal
CodeTF

CodeTF

An open-source Transformer library for state-of-the-art code LLMs.

533Code
Model Evaluation for Extreme Risks

Model Evaluation for Extreme Risks

DeepMind's framework for evaluating models for catastrophic-risk capabilities.

534Evaluation
LLM Research Directions

LLM Research Directions

A list of research directions for students entering LLM research.

535Evaluation
Towards Expert-Level Medical Question Answering (Med-PaLM 2)

Towards Expert-Level Medical Question Answering (Med-PaLM 2)

Google's second-generation medical LLM.

536Evaluation
Are Emergent Abilities of LLMs a Mirage?

Are Emergent Abilities of LLMs a Mirage?

Stanford's critical re-examination of emergent abilities.

537Evaluation
Interpretable ML for Science with PySR

Interpretable ML for Science with PySR

An open-source library for practical symbolic regression in the sciences.

538Safety
Harnessing the Power of LLMs in Practice: A Survey on ChatGPT and Beyond

Harnessing the Power of LLMs in Practice: A Survey on ChatGPT and Beyond

A practical guide for practitioners working with LLMs.

539Evaluation
DataComp

DataComp

A multimodal dataset benchmark with 12.8B image-text pairs.

540Multimodal
ChatGPT for Information Extraction

ChatGPT for Information Extraction

A deeper assessment of ChatGPT on information extraction tasks.

541Evaluation
Comparing Physician vs ChatGPT (JAMA)

Comparing Physician vs ChatGPT (JAMA)

A JAMA Internal Medicine study comparing physician and ChatGPT responses.

542Evaluation
Evaluating Verifiability in Generative Search Engines

Evaluating Verifiability in Generative Search Engines

Audits popular generative search engines for citation accuracy.

543Retrieval
AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models

AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models

A benchmark using real human standardized exams.

544Evaluation
Eight Things to Know about Large Language Models

Eight Things to Know about Large Language Models

Sam Bowman's influential primer on key LLM considerations.

545Evaluation
MACHIAVELLI Benchmark

MACHIAVELLI Benchmark

A benchmark of 134 text-based Choose-Your-Own-Adventure games for measuring ethical trade-offs.

546Evaluation
182 weeks of AI research · papers per week
Week of Sep 28–Oct 4, 202610 papers →
Apr2023
May
Jun
Jul
Aug
Sep
Oct
Nov
Dec
Jan2024
Feb
Mar
Apr
May
Jun
Jul
Aug
Sep
Oct
Nov
Dec
Jan2025
Feb
Mar
Apr
May
Jun
Jul
Aug
Sep
Oct
Nov
Dec
Jan2026
Feb
Mar
Apr
May
Jun
Jul
Aug
Sep
Apr 2023Hover a week to inspect · select to openSep 2026