SkewAdam zaproponował hierarchiczne przydzielanie stanów optymalizatora dla modelu MoE: dla gęstej sieci szkieletowej zachowuje momenty float32 i rozłożone...
论文研究HuggingFace Daily Papers(社区热门论文)
Dzisiejszy biuletyn AI
SkewAdam zaproponował hierarchiczne przydzielanie stanów optymalizatora dla modelu MoE: dla gęstej
sieci szkieletowej zachowuje momenty float32 i rozłożone drugie momenty, dla warstw ekspertów zachowuje tylko rozłożone drugie momenty, a dla routera zachowuje dokładne drugie momenty. W modelu MoE o 6,78 mld parametrów stan optymalizatora zajmuje tylko 1,29 GB (2,6% w porównaniu z AdamW), a szczytowa pamięć treningowa spadła z 81,4 GB do 31,3 GB, co pozwala na załadowanie na akcelerator 40 GB.
Fragment oryginalnego artykułu
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam zaproponował hierarchiczne przydzielanie stanów optymalizatora dla modelu MoE: dla gęstej sieci szkieletowej zachowuje momenty float32 i rozłożone...