Eine neue Studie nutzte Schach als kontrollierte Experimentplattform, um systematisch die Wechselwirkungen zwischen Vortraining und Verstärkendem Lernen (R...
论文研究HuggingFace Daily Papers(社区热门论文)
KI-Informationsbrief des Tages
Eine neue Studie nutzte Schach als kontrollierte Experimentplattform, um systematisch die
Wechselwirkungen zwischen Vortraining und Verstärkendem Lernen (RL) bei Schlussfolgerungsaufgaben zu untersuchen. Die Studie stellte fest, dass die Nachtrainingsleistung bei einem gegebenen RL-Rechenaufwand genau durch den Vortrainingsverlust vorhergesagt werden kann und dass die Steigung der RL-Belohnungskurve mit der Anzahl der Vortrainingstoken nahezu linear ansteigt. Bei mathematischen Sprachmodellen mit 1 Milliarde Parametern erreichen Checkpoints mit längerem Vortraining unter RL eine höhere Leistung und verbessern sich schneller.
Originaler Artikelauszug
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Eine neue Studie nutzte Schach als kontrollierte Experimentplattform, um systematisch die Wechselwirkungen zwischen Vortraining und Verstärkendem Lernen (R...