🚀NEW LABGetting Started with Claude AgentsStart lab
Multimodal

MusicGen

First page
MusicGen
Paper summary

A simple and controllable model for music generation using a single-stage Transformer.

Ask this paper

Key points
01

Single-stage design: Unlike prior hierarchical music models, MusicGen uses a single Transformer predicting interleaved audio tokens.

02

Multi-conditioning: Supports conditioning on text descriptions, melody audio, or both simultaneously.

03

SOTA on text-to-music: Achieves strong performance on standard text-to-music benchmarks while being simpler to train and deploy.

04

Open music generation: Meta's open release of MusicGen weights and code democratized music generation research and spawned community applications.

Every Monday
Get next week’s papers.
Subscribe on Substack