SkewAdam stelt een hiërarchische optimizer-statusallocatie voor MoE-modellen voor: behoud float32-momentum en gedecodeerde tweede-orde momenten voor het de...
论文研究HuggingFace Daily Papers(社区热门论文)
Dagelijkse AI-briefing
SkewAdam stelt een hiërarchische optimizer-statusallocatie voor MoE-modellen voor: behoud
float32-momentum en gedecodeerde tweede-orde momenten voor het dense backbone-netwerk, behoud alleen gedecodeerde tweede-orde momenten voor de expertlaag, en behoud exacte tweede-orde momenten voor de router. Voor een 6,78 miljard parameter MoE neemt de optimizer-status slechts 1,29 GB in beslag (2,6% van AdamW), en het maximale trainingsgeheugen daalt van 81,4 GB naar 31,3 GB, waardoor het in een 40 GB accelerator kan worden geladen.
Fragment uit het originele artikel
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam stelt een hiërarchische optimizer-statusallocatie voor MoE-modellen voor: behoud float32-momentum en gedecodeerde tweede-orde momenten voor het de...