SkewAdam은 MoE 모델을 위해 계층별 옵티마이저 상태 할당을 제안합니다: 밀집 백본 네트워크에는 float32 모멘텀과 분해된 2차 모멘트를 유지하고, 전문가 층에는 분해된 2차 모멘트만 유지하며, 라우터에는 정확한 2차 모멘트를 유지합니다. 6.78B 파라미터 MoE에...
论文研究HuggingFace Daily Papers(社区热门论文)
오늘의 AI 정보 요약
SkewAdam은 MoE 모델을 위해 계층별 옵티마이저 상태 할당을 제안합니다: 밀집 백본 네트워크에는 float32 모멘텀과 분해된 2차 모멘트를 유지하고, 전문가 층에는 분해된
2차 모멘트만 유지하며, 라우터에는 정확한 2차 모멘트를 유지합니다. 6.78B 파라미터 MoE에서 옵티마이저 상태는 단지 1.29 GB(AdamW의 2.6%)를 차지하고, 최고 훈련 메모리는 81.4 GB에서 31.3 GB로 감소하여 40 GB 가속기에 적재할 수 있습니다.
본문 및 출처 설명
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam은 MoE 모델을 위해 계층별 옵티마이저 상태 할당을 제안합니다: 밀집 백본 네트워크에는 float32 모멘텀과 분해된 2차 모멘트를 유지하고, 전문가 층에는 분해된 2차 모멘트만 유지하며, 라우터에는 정확한 2차 모멘트를 유지합니다. 6.78B 파라미터 MoE에...