เพื่อศึกษาความสัมพันธ์ระหว่างการฝึกก่อนและการเรียนรู้แบบเสริมแรง (RL) ในงานด้านการให้เหตุผลอย่างเป็นระบบ การวิจัยพบว่า ประสิทธิภาพหลังการฝึกภายใต้ปริมาณการคำนวณ RL ที่กำหนดสามารถทำนายได้อย่างแม่นยำจากการสูญเสียจากการฝึกก่อน และความชันของกราฟรางวัล RL เพิ่มขึ้นตามจำนวนโทเค็นการฝึกก่อนอย่างใกล้เคียงแบบเชิงเส้น บนโมเดลภาษาเชิงคณิตศาสตร์ที่มีพารามิเตอร์ 1 พันล้าน checkpoint ที่มีการฝึกก่อนนานกว่าจะมีประสิทธิภาพสูงกว่าและพัฒนาเร็วขึ้นภายใต้ RL
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.


