🚀NEW LABGetting Started with Claude AgentsStart lab
Memory · Reinforcement Learning

Adam-mini

First page
Adam-mini
Paper summary

a new optimizer that reduces memory footprint (45%-50% less memory footprint) by using fewer learning rates and achieves on-par or even outperforms AdamW; it carefully partitions parameters into blocks and assigns a single high-quality learning that outperforms Adam; achieves consistent results on language models sized from 125M -7B for pre-training, SFT, and RLHF.

Ask this paper

Every Monday
Get next week’s papers.
Subscribe on Substack