{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T06:40:50.084Z","headline":"从预训练到后训练：理解推理能力的强化学习缩放规律","description":"一项新研究以国际象棋为受控实验平台，系统探究了预训练与强化学习（RL）在推理任务中的交互关系。研究发现，给定RL计算量下的后训练性能可由预训练损失准确预测，且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上，更长预训练的检查点在RL下性能更高、提升更快。","url":"https://www.aioga.com/news/cmrsmh6lu0aj3biwm320odnsc/","mainEntityOfPage":"https://www.aioga.com/news/cmrsmh6lu0aj3biwm320odnsc/","datePublished":"2026-07-17T00:00:00.000Z","dateModified":"2026-07-17T00:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://arxiv.org/abs/2607.16097","https://aihot.virxact.com/items/cmrsmh6lu0aj3biwm320odnsc"],"canonicalUrl":"https://www.aioga.com/news/cmrsmh6lu0aj3biwm320odnsc/","directAnswer":{"@type":"Answer","text":"研究以国际象棋为受控实验平台，考察预训练与强化学习在推理任务中的关系。摘要称，给定强化学习计算量时，后训练性能可由预训练损失预测，奖励曲线斜率随预训练token数近似线性提升。","url":"https://www.aioga.com/news/cmrsmh6lu0aj3biwm320odnsc/","dateCreated":"2026-07-17T00:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"arXiv source article","url":"https://arxiv.org/abs/2607.16097","datePublished":"2026-07-17T00:00:00.000Z","provider":{"@type":"Organization","name":"arXiv","url":"https://arxiv.org/abs/2607.16097"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrsmh6lu0aj3biwm320odnsc","datePublished":"2026-07-17T00:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrsmh6lu0aj3biwm320odnsc"}}],"aggregationSource":"HuggingFace Daily Papers（社区热门论文）","originalPublisher":{"name":"arXiv","url":"https://arxiv.org/abs/2607.16097"},"article":{"id":"cmrsmh6lu0aj3biwm320odnsc","slug":"cmrsmh6lu0aj3biwm320odnsc","url":"https://www.aioga.com/news/cmrsmh6lu0aj3biwm320odnsc/","title":"从预训练到后训练：理解推理能力的强化学习缩放规律","title_en":"Understanding Reasoning from Pretraining to Post-Training","summary":"一项新研究以国际象棋为受控实验平台，系统探究了预训练与强化学习（RL）在推理任务中的交互关系。研究发现，给定RL计算量下的后训练性能可由预训练损失准确预测，且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上，更长预训练的检查点在RL下性能更高、提升更快。","source":"HuggingFace Daily Papers（社区热门论文）","sourceUrl":"https://arxiv.org/abs/2607.16097","aiHotUrl":"https://aihot.virxact.com/items/cmrsmh6lu0aj3biwm320odnsc","publishedAt":"2026-07-17T00:00:00.000Z","category":"论文研究","score":74,"selected":true,"articleBody":["arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.","Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs ：https://info.arxiv.org/labs/index.html."],"articleImages":[{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation.png","alt":"Simons Foundation","afterParagraph":1,"url":"/media/articles/cmrsmh6lu0aj3biwm320odnsc/e2d7f38d62f5ca91.png"},{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation-international.png","alt":"Simons Foundation International","afterParagraph":1,"url":"/media/articles/cmrsmh6lu0aj3biwm320odnsc/1d56e29c5557cbdc.png"},{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/schmidt-sciences.png","alt":"Schmidt Sciences","afterParagraph":1,"url":"/media/articles/cmrsmh6lu0aj3biwm320odnsc/8e18212b8219c104.png"}],"mediaStatus":"ok","articleBodyZh":["arXivLabs 是一个框架，允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。","有一个可以为 arXiv 社区增加价值的项目想法吗？了解更多关于 arXivLabs 的信息：https://info.arxiv.org/labs/index.html。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"研究以国际象棋为受控实验平台，考察预训练与强化学习在推理任务中的关系。摘要称，给定强化学习计算量时，后训练性能可由预训练损失预测，奖励曲线斜率随预训练token数近似线性提升。","background":"该材料关注推理能力从预训练延伸至强化学习后训练时的缩放规律。除国际象棋实验外，摘要还提到1B参数数学语言模型：预训练更久的检查点在强化学习阶段表现更高，提升也更快。","viewpoint":"Aioga 判断，这项研究的价值在于尝试用预训练损失连接后训练表现，为选择进入强化学习阶段的检查点提供可检验线索。不过，现有材料未提供实验配置、误差范围及跨任务结果，结论边界仍需核对论文。","implications":"值得关注的是，如果论文中的预测关系能在更多任务和模型规模上复现，团队可能更容易评估预训练投入与强化学习收益之间的关系。但材料不足以证明该规律可直接推广到其他推理任务或更大模型。","nextStep":"下一步应查阅论文完整方法与实验结果，重点核验预训练损失的预测精度、奖励曲线斜率的拟合方式、国际象棋与数学任务的评测设计，以及不同计算预算和模型规模下是否保持一致。","evidenceRefs":["title","summary","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-07-22T22:09:31.754Z","sourceHash":"c0647926d3334d34","review":{"approved":true,"groundedness":95,"clarity":92,"duplicationRisk":18,"blockingIssues":[],"notes":["“为选择进入强化学习阶段的检查点提供可检验线索”属于基于研究结论的合理推断，且已明确标注为“Aioga 判断”。","候选内容对材料局限和外推条件作了清晰限定，未将国际象棋及1B参数数学语言模型上的发现泛化为普遍规律。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["论文研究","HuggingFace Daily Papers（社区热门论文）"],"translations":{"zh-CN":{"title":"从预训练到后训练：理解推理能力的强化学习缩放规律","summary":"一项新研究以国际象棋为受控实验平台，系统探究了预训练与强化学习（RL）在推理任务中的交互关系。研究发现，给定RL计算量下的后训练性能可由预训练损失准确预测，且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上，更长预训练的检查点在RL下性能更高、提升更快。","category":"论文研究","source":"arXiv","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"从预训练到后训练：理解推理能力的强化学习缩放规律 - Aioga AI资讯","description":"一项新研究以国际象棋为受控实验平台，系统探究了预训练与强化学习（RL）在推理任务中的交互关系。研究发现，给定RL计算量下的后训练性能可由预训练损失准确预测，且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上，更长预训练的检查点在RL下性能更高、提升更快。","url":"https://www.aioga.com/news/cmrsmh6lu0aj3biwm320odnsc/"},"en":{"title":"From Pre-training to Post-training: Understanding the Scaling Laws of Reinforcement Learning for Reasoning Ability","summary":"A new study used chess as a controlled experimental platform to systematically explore the interaction between pretraining and reinforcement learning (RL) in reasoning tasks. The study found that the post-training performance given the RL amount of computation can be accurately predicted by the pretraining loss, and the slope of the RL reward curve increases approximately linearly with the number of pretrained tokens. On a 1B-parameter mathematical language model, checkpoints with longer pretraining perform better and improve faster under RL.","category":"Research","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"From Pre-training to Post-training: Understanding the Scaling Laws of Reinforcement Learning for Reasoning Ability - Aioga AI News","description":"A new study used chess as a controlled experimental platform to systematically explore the interaction between pretraining and reinforcement learning (RL) in reasoning tasks. The s...","url":"https://www.aioga.com/en/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:06:28.096Z"},"ja":{"title":"事前学習から事後学習へ：推論能力の強化学習スケーリング則を理解する","summary":"新しい研究は、チェスを制御された実験プラットフォームとして使用し、推論タスクにおける事前学習と強化学習（RL）の相互関係を体系的に探究した。研究によれば、RLの計算量が与えられた場合、事後学習の性能は事前学習損失によって正確に予測でき、RL報酬曲線の傾きは事前学習トークン数に応じてほぼ線形に上昇することがわかった。1Bパラメータの数学言語モデルにおいて、より長く事前学習されたチェックポイントはRL下で性能が高く、向上も速い。","category":"論文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"事前学習から事後学習へ：推論能力の強化学習スケーリング則を理解する - Aioga AIニュース","description":"新しい研究は、チェスを制御された実験プラットフォームとして使用し、推論タスクにおける事前学習と強化学習（RL）の相互関係を体系的に探究した。研究によれば、RLの計算量が与えられた場合、事後学習の性能は事前学習損失によって正確に予測でき、RL報酬曲線の傾きは事前学習トークン数に応じてほぼ線形に上昇することがわかった。1Bパラメータの数学言語モデルにおいて、より...","url":"https://www.aioga.com/ja/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:06:44.866Z"},"ko":{"title":"사전 학습에서 후속 학습까지: 추론 능력 강화 학습의 확장 법칙 이해","summary":"한 연구는 체스를 통제된 실험 플랫폼으로 사용하여, 추론 과제에서 사전 학습과 강화 학습(RL)의 상호 작용을 체계적으로 탐구했다. 연구 결과, RL 계산량이 주어졌을 때 후속 학습 성능은 사전 학습 손실로 정확히 예측할 수 있으며, RL 보상 곡선의 기울기는 사전 학습 토큰 수에 따라 거의 선형적으로 증가한다는 것을 발견했다. 10억 매개변수 수학 언어 모델에서, 더 긴 사전 학습 체크포인트가 RL 환경에서 더 높은 성능을 보이고, 향상 속도도 더 빠르다.","category":"연구","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"사전 학습에서 후속 학습까지: 추론 능력 강화 학습의 확장 법칙 이해 - Aioga AI 뉴스","description":"한 연구는 체스를 통제된 실험 플랫폼으로 사용하여, 추론 과제에서 사전 학습과 강화 학습(RL)의 상호 작용을 체계적으로 탐구했다. 연구 결과, RL 계산량이 주어졌을 때 후속 학습 성능은 사전 학습 손실로 정확히 예측할 수 있으며, RL 보상 곡선의 기울기는 사전 학습 토큰 수에 따라 거의 선형적으로 증가한다는 것을 발...","url":"https://www.aioga.com/ko/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:07:34.910Z"},"es":{"title":"De preentrenamiento a postentrenamiento: Comprendiendo las leyes de escalamiento del aprendizaje por refuerzo en la capacidad de razonamiento","summary":"Un nuevo estudio utilizó el ajedrez como plataforma experimental controlada para investigar sistemáticamente la interacción entre el preentrenamiento y el aprendizaje por refuerzo (RL) en tareas de razonamiento. El estudio encontró que, dado un cierto volumen de cálculo de RL, el rendimiento después del entrenamiento puede predecirse con precisión a partir de la pérdida del preentrenamiento, y que la pendiente de la curva de recompensa de RL aumenta aproximadamente de manera lineal con el número de tokens de preentrenamiento. En modelos de lenguaje matemático de 1B de parámetros, los puntos de control con preentrenamiento más largo muestran un rendimiento mayor y una mejora más rápida bajo RL.","category":"Investigación","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"De preentrenamiento a postentrenamiento: Comprendiendo las leyes de escalamiento del aprendizaje por refuerzo en la capacidad de razonamiento - Aioga Noticias de IA","description":"Un nuevo estudio utilizó el ajedrez como plataforma experimental controlada para investigar sistemáticamente la interacción entre el preentrenamiento y el aprendizaje por refuerzo...","url":"https://www.aioga.com/es/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:07:32.980Z"},"fr":{"title":"De la pré-formation à la post-formation : Comprendre la loi d'échelle de l'apprentissage par renforcement des capacités de raisonnement","summary":"Une nouvelle étude a utilisé les échecs comme plateforme expérimentale contrôlée pour examiner systématiquement l'interaction entre l'entraînement préalable et l'apprentissage par renforcement (RL) dans les tâches de raisonnement. L'étude a révélé que la performance post-entraînement avec un certain calcul RL pouvait être prédite avec précision par la perte de l'entraînement préalable, et que la pente de la courbe de récompense RL augmentait approximativement de manière linéaire avec le nombre de tokens pré-entraînés. Sur un modèle de langage mathématique de 1 milliard de paramètres, les points de contrôle avec un pré-entraînement plus long montraient de meilleures performances sous RL et une amélioration plus rapide.","category":"Recherche","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"De la pré-formation à la post-formation : Comprendre la loi d'échelle de l'apprentissage par renforcement des capacités de raisonnement - Aioga Actualités IA","description":"Une nouvelle étude a utilisé les échecs comme plateforme expérimentale contrôlée pour examiner systématiquement l'interaction entre l'entraînement préalable et l'apprentissage par...","url":"https://www.aioga.com/fr/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:08:17.474Z"},"de":{"title":"Von Vortraining bis Nachtraining: Verständnis der Skalierungsgesetze des Reinforcement Learning für die Schlussfolgerungsfähigkeit","summary":"Eine neue Studie nutzte Schach als kontrollierte Experimentplattform, um systematisch die Wechselwirkungen zwischen Vortraining und Verstärkendem Lernen (RL) bei Schlussfolgerungsaufgaben zu untersuchen. Die Studie stellte fest, dass die Nachtrainingsleistung bei einem gegebenen RL-Rechenaufwand genau durch den Vortrainingsverlust vorhergesagt werden kann und dass die Steigung der RL-Belohnungskurve mit der Anzahl der Vortrainingstoken nahezu linear ansteigt. Bei mathematischen Sprachmodellen mit 1 Milliarde Parametern erreichen Checkpoints mit längerem Vortraining unter RL eine höhere Leistung und verbessern sich schneller.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Von Vortraining bis Nachtraining: Verständnis der Skalierungsgesetze des Reinforcement Learning für die Schlussfolgerungsfähigkeit - Aioga KI-News","description":"Eine neue Studie nutzte Schach als kontrollierte Experimentplattform, um systematisch die Wechselwirkungen zwischen Vortraining und Verstärkendem Lernen (RL) bei Schlussfolgerungsa...","url":"https://www.aioga.com/de/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:08:21.025Z"},"pt-BR":{"title":"Do pré-treinamento ao pós-treinamento: entendendo as leis de escala de aprendizado por reforço da capacidade de raciocínio","summary":"Um novo estudo usa o xadrez como uma plataforma experimental controlada para investigar sistematicamente a interação entre pré-treinamento e aprendizado por reforço (RL) em tarefas de raciocínio. O estudo descobriu que o desempenho pós-treinamento sob determinada quantidade de cálculo de RL pode ser previsto com precisão pela perda de pré-treinamento, e que a inclinação da curva de recompensa do RL aumenta aproximadamente de forma linear com o número de tokens de pré-treinamento. Em modelos de linguagem matemática com 1 bilhão de parâmetros, os checkpoints de pré-treinamento mais longos apresentam desempenho mais alto e melhora mais rápida sob RL.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Do pré-treinamento ao pós-treinamento: entendendo as leis de escala de aprendizado por reforço da capacidade de raciocínio - Aioga Notícias de IA","description":"Um novo estudo usa o xadrez como uma plataforma experimental controlada para investigar sistematicamente a interação entre pré-treinamento e aprendizado por reforço (RL) em tarefas...","url":"https://www.aioga.com/pt-BR/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:09:04.380Z"},"ru":{"title":"От предварительной подготовки к последующей тренировке: понимание закономерностей масштабирования обучения с подкреплением для усиления способностей к рассуждению","summary":"Новое исследование использовало шахматы в качестве контролируемой экспериментальной платформы для системного изучения взаимодействия предобучения и обучения с подкреплением (RL) в задачах рассуждений. Исследование показало, что последующая после обучения производительность при заданной вычислительной нагрузке RL может быть точно предсказана по потере при предобучении, а наклон кривой вознаграждения RL приблизительно линейно увеличивается с числом токенов предобучения. На математической языковой модели с 1 млрд параметров контрольные точки более длительного предобучения показывали более высокую производительность при RL и более быстрый рост.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"От предварительной подготовки к последующей тренировке: понимание закономерностей масштабирования обучения с подкреплением для усиления способностей к рассуждению - Aioga Новости ИИ","description":"Новое исследование использовало шахматы в качестве контролируемой экспериментальной платформы для системного изучения взаимодействия предобучения и обучения с подкреплением (RL) в...","url":"https://www.aioga.com/ru/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:09:07.225Z"},"ar":{"title":"من التدريب المسبق إلى التدريب اللاحق: فهم قواعد مقياس التعلم المعزز لقدرات الاستدلال","summary":"أظهرت دراسة جديدة استخدام الشطرنج كمنصة تجريبية مضبوطة، لاستكشاف العلاقة التفاعلية بين التدريب المسبق والتعلم المعزز (RL) في مهام الاستدلال بشكل منهجي. ووجدت الدراسة أنه يمكن التنبؤ بدقة بأداء ما بعد التدريب عند حد معين من حساب RL بواسطة خسارة التدريب المسبق، وأن ميل منحنى مكافأة RL يزداد تقريباً بشكل خطي مع عدد الرموز المستخدمة في التدريب المسبق. وعلى نموذج لغة رياضي يحوي 1 مليار معلمة، كانت نقاط التحقق من التدريب المسبق الأطول تؤدي أداء أعلى بسرعة أكبر تحت التعلم المعزز.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"من التدريب المسبق إلى التدريب اللاحق: فهم قواعد مقياس التعلم المعزز لقدرات الاستدلال - Aioga أخبار الذكاء الاصطناعي","description":"أظهرت دراسة جديدة استخدام الشطرنج كمنصة تجريبية مضبوطة، لاستكشاف العلاقة التفاعلية بين التدريب المسبق والتعلم المعزز (RL) في مهام الاستدلال بشكل منهجي. ووجدت الدراسة أنه يمكن التنب...","url":"https://www.aioga.com/ar/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:09:53.064Z"},"hi":{"title":"प्रशिक्षण से पूर्व प्रशिक्षण तक: तर्क क्षमता की सुदृढ़ीकरण सीखने के पैमाने का नियम समझना","summary":"एक नए अध्ययन ने अंतरराष्ट्रीय शतरंज को एक नियंत्रित प्रयोग प्लेटफ़ॉर्म के रूप में उपयोग किया और प्रणालीगत रूप से पूर्व-प्रशिक्षण और सुदृढ़न शिक्षण (RL) के तर्क कार्यों में परस्पर संबंध की जांच की। अध्ययन में पाया गया कि दिए गए RL गणना मात्रा के तहत बाद के प्रशिक्षण प्रदर्शन को पूर्व-प्रशिक्षण हानि के माध्यम से सटीक रूप से भविष्यवाणी किया जा सकता है, और RL पुरस्कार वक्र की ढलान पूर्व-प्रशिक्षण टोकन संख्या के साथ लगभग रैखिक रूप से बढ़ती है। 1B पैरामीटर गणित भाषा मॉडल पर, लंबे पूर्व-प्रशिक्षण वाले चेकपॉइंट RL में उच्च प्रदर्शन और तेजी से सुधार दिखाते हैं।","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"प्रशिक्षण से पूर्व प्रशिक्षण तक: तर्क क्षमता की सुदृढ़ीकरण सीखने के पैमाने का नियम समझना - Aioga AI समाचार","description":"एक नए अध्ययन ने अंतरराष्ट्रीय शतरंज को एक नियंत्रित प्रयोग प्लेटफ़ॉर्म के रूप में उपयोग किया और प्रणालीगत रूप से पूर्व-प्रशिक्षण और सुदृढ़न शिक्षण (RL) के तर्क कार्यों में परस्पर स...","url":"https://www.aioga.com/hi/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:09:56.952Z"},"it":{"title":"Dalla pre-allenamento al post-allenamento: comprendere le regole di scala dell’apprendimento tramite rinforzo delle capacità di ragionamento","summary":"Uno studio recente utilizza gli scacchi come piattaforma sperimentale controllata per esplorare sistematicamente l'interazione tra pre-addestramento e apprendimento per rinforzo (RL) nei compiti di ragionamento. Lo studio ha scoperto che, dato un certo carico computazionale RL, le prestazioni post-addestramento possono essere previste con precisione dalla perdita del pre-addestramento e che la pendenza della curva di ricompensa RL aumenta in modo approssimativamente lineare con il numero di token di pre-addestramento. Su un modello di linguaggio matematico da 1 miliardo di parametri, i checkpoint con pre-addestramento più lungo mostrano prestazioni più elevate e un miglioramento più rapido sotto RL.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Dalla pre-allenamento al post-allenamento: comprendere le regole di scala dell’apprendimento tramite rinforzo delle capacità di ragionamento - Aioga Notizie IA","description":"Uno studio recente utilizza gli scacchi come piattaforma sperimentale controllata per esplorare sistematicamente l'interazione tra pre-addestramento e apprendimento per rinforzo (R...","url":"https://www.aioga.com/it/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:10:48.784Z"},"nl":{"title":"Van voortraining tot natraining: het begrijpen van de schaalregels van versterkingsleren voor redeneringsvermogen","summary":"Een nieuwe studie gebruikte schaken als een gecontroleerd experimenteel platform om systematisch de interactie tussen vooropleiding en versterkend leren (RL) in redeneertaken te onderzoeken. De studie ontdekte dat de prestaties na training, gegeven een RL-computatiehoeveelheid, nauwkeurig kunnen worden voorspeld door het vooropleidingsverlies, en dat de helling van de RL-beloningscurve ongeveer lineair stijgt met het aantal vooropleidingstokens. Bij een wiskundig taalmodel van 1 miljard parameters presteerden checkpoints van langere vooropleiding beter en verbeterden ze sneller onder RL.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Van voortraining tot natraining: het begrijpen van de schaalregels van versterkingsleren voor redeneringsvermogen - Aioga AI-nieuws","description":"Een nieuwe studie gebruikte schaken als een gecontroleerd experimenteel platform om systematisch de interactie tussen vooropleiding en versterkend leren (RL) in redeneertaken te on...","url":"https://www.aioga.com/nl/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:10:40.646Z"},"tr":{"title":"Ön eğitimden sonrası eğitime: Akıl yürütme yeteneğinin takviyeli öğrenme ölçekleme kurallarını anlama","summary":"Yeni bir araştırma, satrancı kontrollü bir deney platformu olarak kullanarak, ön eğitim ile pekiştirmeli öğrenmenin (RL) akıl yürütme görevlerindeki etkileşimini sistematik olarak inceledi. Araştırma, RL hesaplama miktarı verildiğinde, eğitim sonrası performansın ön eğitim kaybıyla doğru bir şekilde tahmin edilebileceğini ve RL ödül eğrisinin eğiminin ön eğitim token sayısıyla yaklaşık olarak lineer arttığını ortaya koydu. 1 milyar parametreli matematik dil modeli üzerinde, daha uzun süren ön eğitimden alınan kontrol noktaları RL altında daha yüksek performans ve daha hızlı artış göstermektedir.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Ön eğitimden sonrası eğitime: Akıl yürütme yeteneğinin takviyeli öğrenme ölçekleme kurallarını anlama - Aioga AI Haberleri","description":"Yeni bir araştırma, satrancı kontrollü bir deney platformu olarak kullanarak, ön eğitim ile pekiştirmeli öğrenmenin (RL) akıl yürütme görevlerindeki etkileşimini sistematik olarak...","url":"https://www.aioga.com/tr/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:11:29.693Z"},"vi":{"title":"Từ tiền huấn luyện đến hậu huấn luyện: Hiểu quy luật mở rộng học tăng cường khả năng suy luận","summary":"Một nghiên cứu mới sử dụng cờ vua làm nền tảng thí nghiệm có kiểm soát, hệ thống nghiên cứu mối quan hệ tương tác giữa học trước đào tạo và học tăng cường (RL) trong các nhiệm vụ suy luận. Nghiên cứu phát hiện rằng, hiệu suất sau đào tạo dưới cùng một lượng tính toán RL có thể được dự đoán chính xác bằng tổn thất học trước đào tạo, và độ dốc của đường cong phần thưởng RL tăng gần như tuyến tính theo số lượng token học trước đào tạo. Trên mô hình ngôn ngữ toán học 1 tỷ tham số, các điểm kiểm tra được đào tạo trước lâu hơn có hiệu suất cao hơn và cải thiện nhanh hơn dưới RL.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Từ tiền huấn luyện đến hậu huấn luyện: Hiểu quy luật mở rộng học tăng cường khả năng suy luận - Tin tức AI Aioga","description":"Một nghiên cứu mới sử dụng cờ vua làm nền tảng thí nghiệm có kiểm soát, hệ thống nghiên cứu mối quan hệ tương tác giữa học trước đào tạo và học tăng cường (RL) trong các nhiệm vụ s...","url":"https://www.aioga.com/vi/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:11:34.830Z"},"id":{"title":"Dari Pra-Pelatihan ke Pascapelatihan: Memahami Pola Skala Pembelajaran Penguatan dari Kemampuan Penalaran","summary":"Sebuah penelitian baru menggunakan catur sebagai platform eksperimen yang terkendali, secara sistematis menyelidiki interaksi antara pra-pelatihan dan pembelajaran penguatan (RL) dalam tugas penalaran. Penelitian menemukan bahwa kinerja pasca-pelatihan dengan jumlah perhitungan RL tertentu dapat diprediksi secara akurat oleh kehilangan pra-pelatihan, dan kemiringan kurva hadiah RL meningkat secara hampir linear seiring dengan jumlah token pra-pelatihan. Pada model bahasa matematis dengan 1 miliar parameter, checkpoint pra-pelatihan yang lebih lama menunjukkan kinerja lebih tinggi dan peningkatan lebih cepat di bawah RL.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Dari Pra-Pelatihan ke Pascapelatihan: Memahami Pola Skala Pembelajaran Penguatan dari Kemampuan Penalaran - Berita AI Aioga","description":"Sebuah penelitian baru menggunakan catur sebagai platform eksperimen yang terkendali, secara sistematis menyelidiki interaksi antara pra-pelatihan dan pembelajaran penguatan (RL) d...","url":"https://www.aioga.com/id/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:12:15.284Z"},"th":{"title":"จากการฝึกก่อนถึงการฝึกหลัง: การเข้าใจกฎการปรับขนาดการเรียนรู้เสริมของความสามารถในการสรุปเหตุผล","summary":"งานวิจัยใหม่ใช้เกมหมากรุกเป็นแพลตฟอร์มทดลองที่ควบคุมได้ เพื่อศึกษาความสัมพันธ์ระหว่างการฝึกก่อนและการเรียนรู้แบบเสริมแรง (RL) ในงานด้านการให้เหตุผลอย่างเป็นระบบ การวิจัยพบว่า ประสิทธิภาพหลังการฝึกภายใต้ปริมาณการคำนวณ RL ที่กำหนดสามารถทำนายได้อย่างแม่นยำจากการสูญเสียจากการฝึกก่อน และความชันของกราฟรางวัล RL เพิ่มขึ้นตามจำนวนโทเค็นการฝึกก่อนอย่างใกล้เคียงแบบเชิงเส้น บนโมเดลภาษาเชิงคณิตศาสตร์ที่มีพารามิเตอร์ 1 พันล้าน checkpoint ที่มีการฝึกก่อนนานกว่าจะมีประสิทธิภาพสูงกว่าและพัฒนาเร็วขึ้นภายใต้ RL","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"จากการฝึกก่อนถึงการฝึกหลัง: การเข้าใจกฎการปรับขนาดการเรียนรู้เสริมของความสามารถในการสรุปเหตุผล - ข่าว AI Aioga","description":"งานวิจัยใหม่ใช้เกมหมากรุกเป็นแพลตฟอร์มทดลองที่ควบคุมได้ เพื่อศึกษาความสัมพันธ์ระหว่างการฝึกก่อนและการเรียนรู้แบบเสริมแรง (RL) ในงานด้านการให้เหตุผลอย่างเป็นระบบ การวิจัยพบว่า ประสิ...","url":"https://www.aioga.com/th/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:12:24.597Z"},"pl":{"title":"Od wstępnego treningu do treningu poźniejszego: zrozumienie reguł skalowania wzmocnienia zdolności wnioskowania","summary":"Nowe badanie wykorzystało szachy jako kontrolowaną platformę eksperymentalną, systematycznie badając interakcję między wstępnym treningiem a uczeniem przez wzmacnianie (RL) w zadaniach związanych z rozumowaniem. Badanie wykazało, że przy danym nakładzie obliczeniowym RL, późniejsze wyniki treningu można dokładnie przewidzieć na podstawie straty wstępnego treningu, a nachylenie krzywej nagrody RL rośnie liniowo w przybliżeniu wraz z liczbą tokenów wstępnego treningu. Na modelu językowym matematycznym o 1 mld parametrów, punkty kontrolne z dłuższym wstępnym treningiem osiągały lepsze wyniki w RL i szybciej się poprawiały.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Od wstępnego treningu do treningu poźniejszego: zrozumienie reguł skalowania wzmocnienia zdolności wnioskowania - Aioga Wiadomości AI","description":"Nowe badanie wykorzystało szachy jako kontrolowaną platformę eksperymentalną, systematycznie badając interakcję między wstępnym treningiem a uczeniem przez wzmacnianie (RL) w zadan...","url":"https://www.aioga.com/pl/news/cmrsmh6lu0aj3biwm320odnsc/","contentTranslated":true,"sourceHash":"4d97bea0b78cbc12","translatedAt":"2026-07-22T17:13:13.091Z"}}}}