SkewAdam propone una distribuzione gerarchica dello stato dell'ottimizzatore per i modelli MoE: riserva il momentum in float32 e i secondi momenti fattoriz...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief quotidiano sull’IA
SkewAdam propone una distribuzione gerarchica dello stato dell'ottimizzatore per i modelli MoE:
riserva il momentum in float32 e i secondi momenti fattorizzati per la rete backbone densa, conserva solo i secondi momenti fattorizzati per il livello degli esperti e mantiene i secondi momenti esatti per il router. Su un MoE da 6,78 miliardi di parametri, lo stato dell'ottimizzatore occupa solo 1,29 GB (il 2,6% di AdamW), la memoria di picco dell'addestramento scende da 81,4 GB a 31,3 GB, consentendo di caricarlo in un acceleratore da 40 GB.
Estratto dell’articolo originale
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam propone una distribuzione gerarchica dello stato dell'ottimizzatore per i modelli MoE: riserva il momentum in float32 e i secondi momenti fattoriz...