От предварительной подготовки к последующей тренировке: понимание закономерностей масштабирования обучения с подкреплением для усиления способностей к рассуждению
Новое исследование использовало шахматы в качестве контролируемой экспериментальной платформы для системного изучения взаимодействия предобучения и обучени...
论文研究HuggingFace Daily Papers(社区热门论文)
Ежедневный обзор ИИ
Новое исследование использовало шахматы в качестве контролируемой экспериментальной платформы для
системного изучения взаимодействия предобучения и обучения с подкреплением (RL) в задачах рассуждений. Исследование показало, что последующая после обучения производительность при заданной вычислительной нагрузке RL может быть точно предсказана по потере при предобучении, а наклон кривой вознаграждения RL приблизительно линейно увеличивается с числом токенов предобучения. На математической языковой модели с 1 млрд параметров контрольные точки более длительного предобучения показывали более высокую производительность при RL и более быстрый рост.
Фрагмент оригинальной статьи
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Новое исследование использовало шахматы в качестве контролируемой экспериментальной платформы для системного изучения взаимодействия предобучения и обучени...