Một nghiên cứu mới sử dụng cờ vua làm nền tảng thí nghiệm có kiểm soát, hệ thống nghiên cứu mối quan hệ tương tác giữa học trước đào tạo và học tăng cường...
论文研究HuggingFace Daily Papers(社区热门论文)
Tóm tắt thông tin AI hôm nay
Một nghiên cứu mới sử dụng cờ vua làm nền tảng thí nghiệm có kiểm soát, hệ thống nghiên cứu mối quan
hệ tương tác giữa học trước đào tạo và học tăng cường (RL) trong các nhiệm vụ suy luận. Nghiên cứu phát hiện rằng, hiệu suất sau đào tạo dưới cùng một lượng tính toán RL có thể được dự đoán chính xác bằng tổn thất học trước đào tạo, và độ dốc của đường cong phần thưởng RL tăng gần như tuyến tính theo số lượng token học trước đào tạo. Trên mô hình ngôn ngữ toán học 1 tỷ tham số, các điểm kiểm tra được đào tạo trước lâu hơn có hiệu suất cao hơn và cải thiện nhanh hơn dưới RL.
Trích đoạn bài viết gốc
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Một nghiên cứu mới sử dụng cờ vua làm nền tảng thí nghiệm có kiểm soát, hệ thống nghiên cứu mối quan hệ tương tác giữa học trước đào tạo và học tăng cường...