Yeni bir araştırma, satrancı kontrollü bir deney platformu olarak kullanarak, ön eğitim ile pekiştirmeli öğrenmenin (RL) akıl yürütme görevlerindeki etkile...
论文研究HuggingFace Daily Papers(社区热门论文)
Bugünün AI bilgi özeti
Yeni bir araştırma, satrancı kontrollü bir deney platformu olarak kullanarak, ön eğitim ile
pekiştirmeli öğrenmenin (RL) akıl yürütme görevlerindeki etkileşimini sistematik olarak inceledi. Araştırma, RL hesaplama miktarı verildiğinde, eğitim sonrası performansın ön eğitim kaybıyla doğru bir şekilde tahmin edilebileceğini ve RL ödül eğrisinin eğiminin ön eğitim token sayısıyla yaklaşık olarak lineer arttığını ortaya koydu. 1 milyar parametreli matematik dil modeli üzerinde, daha uzun süren ön eğitimden alınan kontrol noktaları RL altında daha yüksek performans ve daha hızlı artış göstermektedir.
Orijinal makale alıntısı
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Yeni bir araştırma, satrancı kontrollü bir deney platformu olarak kullanarak, ön eğitim ile pekiştirmeli öğrenmenin (RL) akıl yürütme görevlerindeki etkile...