SkewAdam propone una asignación jerárquica del estado del optimizador para modelos MoE: conserva el momentum en float32 y los momentos de segundo orden des...
论文研究HuggingFace Daily Papers(社区热门论文)
Resumen diario de inteligencia IA
SkewAdam propone una asignación jerárquica del estado del optimizador para modelos MoE: conserva el
momentum en float32 y los momentos de segundo orden descompuestos para la red troncal densa, conserva solo los momentos de segundo orden descompuestos para las capas de expertos y conserva momentos de segundo orden precisos para el enrutador. En un MoE de 6.78B parámetros, el estado del optimizador ocupa solo 1.29 GB (el 2.6% de AdamW), y la memoria máxima de entrenamiento se reduce de 81.4 GB a 31.3 GB, pudiéndose cargar en un acelerador de 40 GB.
Artículo y notas de fuente
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam propone una asignación jerárquica del estado del optimizador para modelos MoE: conserva el momentum en float32 y los momentos de segundo orden des...