SkewAdam propôs uma alocação hierárquica do estado do otimizador para modelos MoE: mantém momentum em float32 e momentos de segunda ordem decompostos para...
论文研究HuggingFace Daily Papers(社区热门论文)
Resumo diário de inteligência em IA
SkewAdam propôs uma alocação hierárquica do estado do otimizador para modelos MoE: mantém momentum
em float32 e momentos de segunda ordem decompostos para a rede densa principal, mantém apenas momentos de segunda ordem decompostos para a camada de especialistas, e mantém momentos de segunda ordem precisos para o roteador. Em um MoE de 6,78 bilhões de parâmetros, o estado do otimizador ocupa apenas 1,29 GB (2,6% do AdamW), e a memória máxima de treinamento caiu de 81,4 GB para 31,3 GB, podendo ser carregada em um acelerador de 40 GB.
Trecho do artigo original
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam propôs uma alocação hierárquica do estado do otimizador para modelos MoE: mantém momentum em float32 e momentos de segunda ordem decompostos para...