Nowe badanie wykorzystało szachy jako kontrolowaną platformę eksperymentalną, systematycznie badając interakcję między wstępnym treningiem a uczeniem przez...
论文研究HuggingFace Daily Papers(社区热门论文)
Dzisiejszy biuletyn AI
Nowe badanie wykorzystało szachy jako kontrolowaną platformę eksperymentalną, systematycznie badając
interakcję między wstępnym treningiem a uczeniem przez wzmacnianie (RL) w zadaniach związanych z rozumowaniem. Badanie wykazało, że przy danym nakładzie obliczeniowym RL, późniejsze wyniki treningu można dokładnie przewidzieć na podstawie straty wstępnego treningu, a nachylenie krzywej nagrody RL rośnie liniowo w przybliżeniu wraz z liczbą tokenów wstępnego treningu. Na modelu językowym matematycznym o 1 mld parametrów, punkty kontrolne z dłuższym wstępnym treningiem osiągały lepsze wyniki w RL i szybciej się poprawiały.
Fragment oryginalnego artykułu
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Nowe badanie wykorzystało szachy jako kontrolowaną platformę eksperymentalną, systematycznie badając interakcję między wstępnym treningiem a uczeniem przez...