SkewAdam đề xuất phân bổ trạng thái bộ tối ưu theo lớp cho mô hình MoE: giữ động lượng float32 và ma trận hạng hai phân rã cho mạng xương sống dày đặc, chỉ...
论文研究HuggingFace Daily Papers(社区热门论文)
Tóm tắt thông tin AI hôm nay
SkewAdam đề xuất phân bổ trạng thái bộ tối ưu theo lớp cho mô hình MoE: giữ động lượng float32 và ma
trận hạng hai phân rã cho mạng xương sống dày đặc, chỉ giữ ma trận hạng hai phân rã cho lớp chuyên gia, và giữ ma trận hạng hai chính xác cho bộ định tuyến. Trên MoE 6,78 tỷ tham số, trạng thái bộ tối ưu chỉ chiếm 1,29 GB (2,6% của AdamW), bộ nhớ đỉnh trong huấn luyện giảm từ 81,4 GB xuống còn 31,3 GB, có thể vừa với bộ tăng tốc 40 GB.
Trích đoạn bài viết gốc
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
SkewAdam đề xuất phân bổ trạng thái bộ tối ưu theo lớp cho mô hình MoE: giữ động lượng float32 và ma trận hạng hai phân rã cho mạng xương sống dày đặc, chỉ...