Sebuah penelitian baru menggunakan catur sebagai platform eksperimen yang terkendali, secara sistematis menyelidiki interaksi antara pra-pelatihan dan pemb...
论文研究HuggingFace Daily Papers(社区热门论文)
Ringkasan intelijen AI hari ini
Sebuah penelitian baru menggunakan catur sebagai platform eksperimen yang terkendali, secara
sistematis menyelidiki interaksi antara pra-pelatihan dan pembelajaran penguatan (RL) dalam tugas penalaran. Penelitian menemukan bahwa kinerja pasca-pelatihan dengan jumlah perhitungan RL tertentu dapat diprediksi secara akurat oleh kehilangan pra-pelatihan, dan kemiringan kurva hadiah RL meningkat secara hampir linear seiring dengan jumlah token pra-pelatihan. Pada model bahasa matematis dengan 1 miliar parameter, checkpoint pra-pelatihan yang lebih lama menunjukkan kinerja lebih tinggi dan peningkatan lebih cepat di bawah RL.
Kutipan artikel asli
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Sebuah penelitian baru menggunakan catur sebagai platform eksperimen yang terkendali, secara sistematis menyelidiki interaksi antara pra-pelatihan dan pemb...