Une nouvelle étude a utilisé les échecs comme plateforme expérimentale contrôlée pour examiner systématiquement l'interaction entre l'entraînement préalabl...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief IA du jour
Une nouvelle étude a utilisé les échecs comme plateforme expérimentale contrôlée pour examiner
systématiquement l'interaction entre l'entraînement préalable et l'apprentissage par renforcement (RL) dans les tâches de raisonnement. L'étude a révélé que la performance post-entraînement avec un certain calcul RL pouvait être prédite avec précision par la perte de l'entraînement préalable, et que la pente de la courbe de récompense RL augmentait approximativement de manière linéaire avec le nombre de tokens pré-entraînés. Sur un modèle de langage mathématique de 1 milliard de paramètres, les points de contrôle avec un pré-entraînement plus long montraient de meilleures performances sous RL et une amélioration plus rapide.
Article et notes de source
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Une nouvelle étude a utilisé les échecs comme plateforme expérimentale contrôlée pour examiner systématiquement l'interaction entre l'entraînement préalabl...