SkewAdam propose une allocation hiérarchique des états de l'optimiseur pour les modèles MoE : conserver la quantité de mouvement en float32 et la décomposi...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief IA du jour
SkewAdam propose une allocation hiérarchique des états de l'optimiseur pour les modèles MoE :
conserver la quantité de mouvement en float32 et la décomposition des secondes matrices pour le réseau central dense, conserver uniquement la décomposition des secondes matrices pour les couches d'experts, et conserver les secondes matrices exactes pour le routeur. Sur un MoE de 6,78 milliards de paramètres, l'état de l'optimiseur ne représente que 1,29 Go (2,6 % de AdamW), la mémoire de formation maximale passe de 81,4 Go à 31,3 Go, ce qui permet de la charger sur un accélérateur de 40 Go.
Article et notes de source
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam propose une allocation hiérarchique des états de l'optimiseur pour les modèles MoE : conserver la quantité de mouvement en float32 et la décomposi...