SkewAdam mengusulkan distribusi status optimizer bertingkat untuk model MoE: mempertahankan momentum float32 dan momen kuadrat terdekomposisi untuk jaringa...
论文研究HuggingFace Daily Papers(社区热门论文)
Ringkasan intelijen AI hari ini
SkewAdam mengusulkan distribusi status optimizer bertingkat untuk model MoE: mempertahankan momentum
float32 dan momen kuadrat terdekomposisi untuk jaringan inti padat, hanya mempertahankan momen kuadrat terdekomposisi untuk lapisan ahli, dan mempertahankan momen kuadrat presisi untuk pengarah. Pada MoE dengan 6,78 miliar parameter, status optimizer hanya memakan 1,29 GB (2,6% dari AdamW), puncak memori pelatihan turun dari 81,4 GB menjadi 31,3 GB, sehingga bisa dimuat ke akselerator 40 GB.
Kutipan artikel asli
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam mengusulkan distribusi status optimizer bertingkat untuk model MoE: mempertahankan momentum float32 dan momen kuadrat terdekomposisi untuk jaringa...