SkewAdam предложил распределение состояния оптимизатора по уровням для модели MoE: для плотной основной сети сохраняются моменты float32 и разложенные втор...
论文研究HuggingFace Daily Papers(社区热门论文)
Ежедневный обзор ИИ
SkewAdam предложил распределение состояния оптимизатора по уровням для модели MoE: для плотной
основной сети сохраняются моменты float32 и разложенные вторые моменты, для экспертного слоя сохраняются только разложенные вторые моменты, а для маршрутизатора сохраняются точные вторые моменты. На модели MoE с 6,78 миллиарда параметров состояние оптимизатора занимает всего 1,29 ГБ (2,6% от AdamW), пик использования памяти при обучении снизился с 81,4 ГБ до 31,3 ГБ, что позволяет загрузить модель на 40 ГБ ускоритель.
Фрагмент оригинальной статьи
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam предложил распределение состояния оптимизатора по уровням для модели MoE: для плотной основной сети сохраняются моменты float32 и разложенные втор...