أظهرت دراسة جديدة استخدام الشطرنج كمنصة تجريبية مضبوطة، لاستكشاف العلاقة التفاعلية بين التدريب المسبق والتعلم المعزز (RL) في مهام الاستدلال بشكل منهجي. ووج...
论文研究HuggingFace Daily Papers(社区热门论文)
ملخص معلومات AI اليوم
أظهرت دراسة جديدة استخدام الشطرنج كمنصة تجريبية مضبوطة، لاستكشاف العلاقة التفاعلية بين التدريب
المسبق والتعلم المعزز (RL) في مهام الاستدلال بشكل منهجي. ووجدت الدراسة أنه يمكن التنبؤ بدقة بأداء ما بعد التدريب عند حد معين من حساب RL بواسطة خسارة التدريب المسبق، وأن ميل منحنى مكافأة RL يزداد تقريباً بشكل خطي مع عدد الرموز المستخدمة في التدريب المسبق. وعلى نموذج لغة رياضي يحوي 1 مليار معلمة، كانت نقاط التحقق من التدريب المسبق الأطول تؤدي أداء أعلى بسرعة أكبر تحت التعلم المعزز.
مقتطف من المقال الأصلي
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
أظهرت دراسة جديدة استخدام الشطرنج كمنصة تجريبية مضبوطة، لاستكشاف العلاقة التفاعلية بين التدريب المسبق والتعلم المعزز (RL) في مهام الاستدلال بشكل منهجي. ووج...