Un nuevo estudio utilizó el ajedrez como plataforma experimental controlada para investigar sistemáticamente la interacción entre el preentrenamiento y el...
论文研究HuggingFace Daily Papers(社区热门论文)
Resumen diario de inteligencia IA
Un nuevo estudio utilizó el ajedrez como plataforma experimental controlada para investigar
sistemáticamente la interacción entre el preentrenamiento y el aprendizaje por refuerzo (RL) en tareas de razonamiento. El estudio encontró que, dado un cierto volumen de cálculo de RL, el rendimiento después del entrenamiento puede predecirse con precisión a partir de la pérdida del preentrenamiento, y que la pendiente de la curva de recompensa de RL aumenta aproximadamente de manera lineal con el número de tokens de preentrenamiento. En modelos de lenguaje matemático de 1B de parámetros, los puntos de control con preentrenamiento más largo muestran un rendimiento mayor y una mejora más rápida bajo RL.
Artículo y notas de fuente
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Un nuevo estudio utilizó el ajedrez como plataforma experimental controlada para investigar sistemáticamente la interacción entre el preentrenamiento y el...