Uno studio recente utilizza gli scacchi come piattaforma sperimentale controllata per esplorare sistematicamente l'interazione tra pre-addestramento e appr...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief quotidiano sull’IA
Uno studio recente utilizza gli scacchi come piattaforma sperimentale controllata per esplorare
sistematicamente l'interazione tra pre-addestramento e apprendimento per rinforzo (RL) nei compiti di ragionamento. Lo studio ha scoperto che, dato un certo carico computazionale RL, le prestazioni post-addestramento possono essere previste con precisione dalla perdita del pre-addestramento e che la pendenza della curva di ricompensa RL aumenta in modo approssimativamente lineare con il numero di token di pre-addestramento. Su un modello di linguaggio matematico da 1 miliardo di parametri, i checkpoint con pre-addestramento più lungo mostrano prestazioni più elevate e un miglioramento più rapido sotto RL.
Estratto dell’articolo originale
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Uno studio recente utilizza gli scacchi come piattaforma sperimentale controllata per esplorare sistematicamente l'interazione tra pre-addestramento e appr...