एक नए अध्ययन ने अंतरराष्ट्रीय शतरंज को एक नियंत्रित प्रयोग प्लेटफ़ॉर्म के रूप में उपयोग किया और प्रणालीगत रूप से पूर्व-प्रशिक्षण और सुदृढ़न शिक्षण (RL) के...
论文研究HuggingFace Daily Papers(社区热门论文)
आज का AI इंटेलिजेंस ब्रीफ
एक नए अध्ययन ने अंतरराष्ट्रीय शतरंज को एक नियंत्रित प्रयोग प्लेटफ़ॉर्म के रूप में उपयोग किया और
प्रणालीगत रूप से पूर्व-प्रशिक्षण और सुदृढ़न शिक्षण (RL) के तर्क कार्यों में परस्पर संबंध की जांच की। अध्ययन में पाया गया कि दिए गए RL गणना मात्रा के तहत बाद के प्रशिक्षण प्रदर्शन को पूर्व-प्रशिक्षण हानि के माध्यम से सटीक रूप से भविष्यवाणी किया जा सकता है, और RL पुरस्कार वक्र की ढलान पूर्व-प्रशिक्षण टोकन संख्या के साथ लगभग रैखिक रूप से बढ़ती है। 1B पैरामीटर गणित भाषा मॉडल पर, लंबे पूर्व-प्रशिक्षण वाले चेकपॉइंट RL में उच्च प्रदर्शन और तेजी से सुधार दिखाते हैं।
मूल लेख का अंश
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
एक नए अध्ययन ने अंतरराष्ट्रीय शतरंज को एक नियंत्रित प्रयोग प्लेटफ़ॉर्म के रूप में उपयोग किया और प्रणालीगत रूप से पूर्व-प्रशिक्षण और सुदृढ़न शिक्षण (RL) के...