Aioga
AI资讯 / 论文研究
返回 AI资讯

CrucibleBench 用 MUD 游戏评估 LLM:99 美元概念验证

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-23T02:51:29.850Z热度 46

CrucibleBench 将大语言模型置于持久化文本世界(MUD)中,NPC 拥有记忆、信任积累机制且错误会留下痕迹,通过 50 轮交互评分。该概念验证成本仅 99 美元,旨...

论文研究Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

CrucibleBench 将大语言模型置于持久化文本世界(MUD)中,NPC 拥有记忆、信任积累机制且错误会留下痕迹,通过 50 轮交互评分。

该概念验证成本仅 99 美元,旨在测试 LLM 在长期社交与任务场景中的表现。

中文正文 · AI 翻译

CrucibleBench将语言模型置于一个持久的MUD中,这是一个文本世界,NPC会记住事情,信任会积累,错误会留下痕迹,并在50回合内根据隐藏的社交目标对它们的行为进行评分。

来自运行05(种子20260496)的逐字记录:GPT-5.4在兵营中发现一枚雕纹戒指,将其归还给主人,并在50回合中的第14回合获得推荐信。所有650份记录随发布一起提供。

任天堂的横井军平使用该短语来描述一种设计理念:使用成熟、廉价、易理解的技术,并以新的方式应用它。CrucibleBench将其应用于AI评估。

我们没有采用照片级逼真的模拟或浏览器自动化,而是从MUD开始:多用户地下城,早期互联网的持久文本世界。其限制正是重点:有限的命令空间使幻觉行为可被检测,具有信任和怀疑状态的NPC会提供明确的社交反馈,并且运行内的持久性意味着获得的物品会保持,赢得的信任会保留。

我们选择MUD并不是因为它有趣,而是因为它的限制使行为可测量。

静态基准测试衡量模型在孤立环境下的知识。它们无法衡量模型在必须获得信任、信息受关系限制以及直接提问会引起怀疑的环境下的行为。

7种命令类型,12个房间,14件物品。幻觉行为和错误房间的互动是可检测的,并且动作效率可以测量。

4个NPC拥有信任和怀疑状态(0-100),会根据对话变化:模型可以在一次运行中适应这些反馈,也可能失败。

获得的物品会保留;赢得的信任会保持。每次运行都会留下完整且可回放的探索和计划记录。

评分堆栈中的单一LLM裁判组件曾使排行榜最多改变六个名次,而所有汇总的可靠性统计保持不变。我们在两种评分配置下报告每个结果,并将这种差异视为论文中最具普遍性的重要发现。

四个评分维度中的两个通过对话分类器进行评估,其每个模型与独立评审员的一致性范围为21.7%到84.8%,而整体κ值=0.04从未显示出不稳定性。移除依赖分类器的维度会使六个排名超出情景抽样噪声(90%配对区块自助法)。

变化最大的模型与分类器属于同一模型家族。使用大型语言模型(LLM)评审员的基准测试应报告每个主题的一致性和在淘汰评审员情况下的排名稳定性,而不仅仅报告整体可靠性。

1–5分量表的平均分,按分类器最小化的子总分排序。每个模型运行50次:5个随机种子 × 2个目标 × 5次重复,温度0.3,经OpenRouter验证计费。排名为探索性质;前八名的置信区间重叠明显。完整协议、置信区间和统计数据见白皮书:whitepaper.pdf。

三种失败模式,每种都通过状态机遥测算法检测,无需评审员参与。对测试的每个模型(包括前沿模型)而言,对话循环是主要模式。

单次运行中,单个NPC的交谈命令达到八次或更多。智能体重复失败的对话方法而不进行适应:类似持久世界中的支持型智能体自我重复。

交谈命令得到回答“这里没有人”。显示世界状态追踪丢失,类似于调用不在范围内的API。Grok 4是唯一在前沿模型中出现显著情况的模型(12%)。

在二十余回合内访问两间或更少房间,或连续五次使用查看命令。信息收集从未转化为目标导向的行动。

逐字记录自运行03(种子20260399):OLMo向不存在的守卫致意,试图与一个物品(street_crystal)交谈,然后在最后15回合中在船长处循环。

CrucibleBench是独立研究项目。第二阶段正在为校准而构建;现已公布临时低/基础/高预算,最终分配将根据试点数据和预注册进行。进入方式有三种。

资助 · 临时$3,500封装 构建 · 环境、目标、校准 运行 · 校准后试点组

有问题或想进行私人评估?请写信至contact@cruciblebench.ai:mailto:contact@cruciblebench.ai

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:CrucibleBench 将大语言模型置于持久化文本世界(MUD)中,NPC 拥有记忆、信任积累机制且错误会留下痕迹,通过 50 轮交互评分。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: cruciblebench.ai

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-23T02:51:29.850Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

CrucibleBench 将大语言模型置于持久化文本世界(MUD)中,NPC 拥有记忆、信任积累机制且错误会留下痕迹,通过 50 轮交互评分。该概念验证成本仅 99 美元,旨...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-23T02:51:29.850Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。