SkewAdam schlägt für MoE-Modelle eine hierarchische Optimiererzustandsaufteilung vor: Für das dichte Backbonenetzwerk werden Float32-Momente und zerlegte z...
论文研究HuggingFace Daily Papers(社区热门论文)
KI-Informationsbrief des Tages
SkewAdam schlägt für MoE-Modelle eine hierarchische Optimiererzustandsaufteilung vor: Für das dichte
Backbonenetzwerk werden Float32-Momente und zerlegte zweite Momente beibehalten, für die Expertenebene nur zerlegte zweite Momente, für den Router werden exakte zweite Momente beibehalten. Bei einem 6,78-Milliarden-Parameter-MoE nimmt der Optimiererzustand nur 1,29 GB ein (2,6 % von AdamW), der Spitzenwert des Trainingsspeichers sinkt von 81,4 GB auf 31,3 GB und kann auf einen 40-GB-Beschleuniger geladen werden.
Originaler Artikelauszug
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam schlägt für MoE-Modelle eine hierarchische Optimiererzustandsaufteilung vor: Für das dichte Backbonenetzwerk werden Float32-Momente und zerlegte z...