Aioga
AI资讯 / AI资讯
返回 AI资讯

TutorMoments: Do AI tutors know when to help and when to hold back?

Hugging Face:Blog(RSS)Aioga 编辑团队2026-08-07T17:53:32.000Z热度

What makes a good tutor? :#what-makes-a-good-tutor How TutorMoments works :#how-tutormom...

AI资讯Hugging Face:Blog(RSS)

今日 AI 情报摘要

What makes a good tutor?

:#what-makes-a-good-tutor How TutorMoments works :#how-tutormoments-works Preliminary results :#preliminary-results Limitations and next steps :#limitations-and-next-steps 📄 Tech Report: c/paper/tutormoments-preview.pdf:https://tutormoments.allen.ai/static/paper/tutormoments-preview.pdf 📊 Data: o/datasets/allenai/tutormoments-preview:https://huggingface.co/datasets/allenai/tutormoments-preview 💻 Code: https://github.com/allenai/tutormoments:https://github.com/allenai/tutormoments s://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/LlOloe_6sFprFVqSBBk5t.png Today we're introducing a preview of TutorMoments :https://tutormoments.allen.ai/, a framework to measure whether cutting-edge LLMs can balance one of the hardest trade-offs in education: when to step in and help a studen

中文正文 · AI 翻译

一个好导师需要具备什么?:#what-makes-a-good-tutor TutorMoments 的工作原理:#how-tutormoments-works 初步结果:#preliminary-results 限制与后续步骤:#limitations-and-next-steps 📄 技术报告: https://tutormoments.allen.ai/static/paper/tutormoments-preview.pdf:https://tutormoments.allen.ai/static/paper/tutormoments-preview.pdf | 📊 数据: https://huggingface.co/datasets/allenai/tutormoments-preview:https://huggingface.co/datasets/allenai/tutormoments-preview | 💻 代码: https://github.com/allenai/tutormoments:https://github.com/allenai/tutormoments

TutorMoments social copy - Google Docs-image-1 (2)

:https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/LlOloe_6sFprFVqSBBk5t.png

今天我们要介绍的是 TutorMoments 的预览版:https://tutormoments.allen.ai/,这是一个衡量前沿法学硕士是否能够平衡教育中最困难的权衡之一的框架:何时介入并帮助学生,何时阻止并让学生做更多的工作。

TutorMoments 是基于重放的评估工具,建立在真实一对一的数学辅导课程之上。经验丰富的数学教师会查看从美国辅导项目收集的课程记录,并标记导师必须在“让问题更容易以便学生入手”与“推动学生自己进行更多推理”之间做出选择的时刻。然后,TutorMoments 会截取该决策点之前的课程记录,把它交给语言模型,让模型在模拟课程中接管导师角色——由另一语言模型扮演学生——以观察大型语言模型导师会如何操作。

仅被告知“好好辅导”,我们发现模型倾向于过度帮助,提供过多支持,很少促使学生进行更深入的思考。在导师提示中明确说明这一权衡(何时帮助何时克制)能够提升表现,但仍无法达到持续匹配情境的人类辅导水平,而且不同 LLM 在如何可靠地做出这一判断上仍存在很大差异。

作为我们对开放研究承诺的一部分,我们正在发布一个已去标识的辅导对话数据集:https://huggingface.co/datasets/allenai/tutormoments-preview,以及用于运行我们回放管线的代码:https://github.com/allenai/tutormoments,同时还提供我们评估这些对话中关键时刻的模型导师回放,以便可复现性。我们希望 TutorMoments 能为教育工作者、研究人员以及构建 AI 导师的团队提供更清晰的方法,了解模型如何处理最重要的教学决策——并帮助该领域构建可以适应每个学生的导师,而不是替他们完成工作。

向一个优秀的数学导师寻求帮助时,你很可能会得到这样一个问题作为回应:“你对这个问题的要求了解多少?”这并不是不够帮助——优秀教学的一部分就是诊断学生已经掌握了什么,并在当下提供合适的支持。立刻提供支持会剥夺学生进行智力工作的机会,而这种工作正是帮助他们学习的关键。有时需要支持;而有时最有效的做法是推动学生通过解释正确答案来巩固理解。

然而,语言模型是被训练成提供帮助的,有帮助的助手往往会为你完成困难的部分——解释概念、列出步骤,并引导你找到答案。在辅导课堂上,这可能会缩短建设性挣扎的时间——即那种努力、有时令人沮丧的解决问题的过程,而学习研究长期以来将其与更强的理解力联系在一起。

大多数作为导师的语言模型的基准测试并未捕捉到这种张力。它们往往会特别奖励某种行为——例如绝不直接给出问题答案,或者总是提供提示——而不考虑这是否是针对学生实际理解情况的正确做法。但良好的辅导并不是可以在所有情况下固定识别的单一行为。这是一种判断:这个学生在当前这个问题上现在最需要的是什么?

TutorMoments 建立在真实辅导数据之上。我们发布的数据集 TutorMoments-Preview:https://huggingface.co/datasets/allenai/tutormoments-preview,包含 462 份去标识化的、仅文本的一对一数学辅导记录,针对美国二至七年级学生,由教师标注了超过 1,500 个关键时刻,以及 27 位美国教师注释者提供的数千条自由文本注释。这些记录来自一个高剂量辅导项目,项目学生大多就读于 Title I 学校,根据家长和监护人同意的研究条款共享;所有数据在提供方处理后,再经过一个附加的数学智能管道去除了身份信息。

所有注释均来自经验丰富的数学教师,我们要求他们阅读记录并标记关键学习时刻——记录发生了什么,辅导老师做了什么,以及学生的反应如何。每个关键时刻都是辅导老师必须权衡支架式教学(使问题更易理解)和推动严格性(鼓励学生进行更高层次思考)的决策点。

TutorMoments 的运作方式是在某个关键时刻暂停记录,并将会话交给语言模型,由其作为辅导老师与模拟学生进行五轮辅导。我们将每个由模型生成的延续称为重放。然后基于 LLM 的评分管道对每次重放进行三方面评分:模型是否(1)在学生需要支持时提供了支架,(2) 在学生准备好接受更大挑战时推动了严格性,以及 (3) 避免了过度支架(降低挑战超过该时刻所需)。

评分管道以教师定义的真实结果开始:对于每个关键时刻,是需要支架还是需要推动严格性。每个时刻由多位教师注释,当意见不一致时,我们取多数标签——例如,如果三位教师为某个时刻注释,其中两位选择严格性,而一位选择支架,真实结果就为严格性。一个独立的语言模型分类器会根据教师注释进行验证,然后决定辅导老师的实际行为是否与该时刻所需一致——“适当”的回合意味着辅导老师的分类行为(支架、推动严格性或过度支架)与教师判断的时刻需求相符。

我们用两个提示将七个大型语言模型(LLMs)通过 TutorMoments 进行测试:一个普通提示,没有提供实际指导——它只告诉模型利用已知的良好辅导方法来回应学生——以及一个评估意识提示,明确说明了支架、过度支架和推动严谨性之间的权衡。每个模型都根据辅导记录中的关键时刻进行评分,这些时刻平均分布在适合使用支架的方法和需要严格要求的情况下。

表格中的每个数字都是介于 0 和 1 之间的评分——表示模型在相关时刻做出适当行为的比例——因此分数越高,模型做出正确判断的次数越多。例如,适当严谨性的 0.50 意味着模型在需要严谨性的一半时刻成功地提出了严谨要求。

阅读评分时,需要注意以下几点:

人类辅导员是自然参考,而非上限。我们不把人类辅导员视为理想实践的模型——即便是有经验的辅导员在瞬间也会做出不够理想的选择。按照相同的决策点同样评分,我们记录的辅导员得分为 0.458(适当支架)、0.182(适当严谨)和 0.496(避免过度支架)——都低于模型的评估意识得分,并大致处于普通提示分数的范围内。但这并不意味着 AI 辅导优于人类教师。标注者专门寻找辅导可以做得更好的时刻,因此数据集集中于错失的机会,而非理想实践。

这些分数衡量的是辅导员行为,而不是学习效果。重播中使用的是模拟的“oracle”学生,因此数字反映的是模型在决策点的行为——而非真实学生是否学会了知识。

严谨性比支架更不稳定。评分流程对严谨性的识别不如支架可靠,并且在基础标注中,严谨时刻(260 个)比支架时刻(738 个)要少。

TutorMoments social copy - Google Docs-image-2 (1)

:https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/iJjIPaPGPMCpnMrFiYxIZ.png

表格中最清晰的模式是提示的重要性:每个模型在有评估意识的提示下的得分都高于普通提示下的得分。这表明,模型默认的“有帮助的助手”行为本身不足以成为优秀的辅导者。但在提示中明确说明权衡虽然有所帮助——它提升了每个分数——模型在解释增强提示的方式上仍存在很大差异,即使是得分最高的模型也有很大提升空间。

我们还分析了辅导者在每种情境下所采取的动作。虽然提示鼓励模型追求严谨,但它们使用的策略比人类少,通常依赖于要求学生解释答案。相比之下,人类辅导者采用的策略更为多样,更有可能后退一步,让学生独立完成任务。

TutorMoments 仍处于早期开发阶段,目前存在一些局限性。最大的问题是,自动化评估可以提供模型在决策点的行为信号,但不能替代真实学生和真实学习成果的研究。数据集也比较狭窄:基于美国,主要是小学和初中数学,由单一教育者群体标注。我们的发现可能无法推广到其他学科、年级或环境。

我们分享这一预览是为了在构建更大、多模态数据集、更强评分流程和更深入分析的过程中收集反馈。

该项目部分得益于盖茨基金会和学习共享平台(Learning Commons)的支持。

TutorMoments: Do AI tutors know when to help and when to hold back?

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:What makes a good tutor? Aioga 将其归入「AI资讯」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:AI 行业动态需要结合来源、时间、实际可用性和后续反馈判断,标题或单次发布本身不能替代完整证据。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察原文更新、官方说明、用户反馈和同类产品的后续动作。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: huggingface.co

来源: Hugging Face:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-07T17:53:32.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

What makes a good tutor? :#what-makes-a-good-tutor How TutorMoments works :#how-tutormom...

Hugging Face:Blog(RSS)2026-08-07T17:53:32.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。