Um novo estudo usa o xadrez como uma plataforma experimental controlada para investigar sistematicamente a interação entre pré-treinamento e aprendizado po...
论文研究HuggingFace Daily Papers(社区热门论文)
Resumo diário de inteligência em IA
Um novo estudo usa o xadrez como uma plataforma experimental controlada para investigar
sistematicamente a interação entre pré-treinamento e aprendizado por reforço (RL) em tarefas de raciocínio. O estudo descobriu que o desempenho pós-treinamento sob determinada quantidade de cálculo de RL pode ser previsto com precisão pela perda de pré-treinamento, e que a inclinação da curva de recompensa do RL aumenta aproximadamente de forma linear com o número de tokens de pré-treinamento. Em modelos de linguagem matemática com 1 bilhão de parâmetros, os checkpoints de pré-treinamento mais longos apresentam desempenho mais alto e melhora mais rápida sob RL.
Trecho do artigo original
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Um novo estudo usa o xadrez como uma plataforma experimental controlada para investigar sistematicamente a interação entre pré-treinamento e aprendizado po...