研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。
当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;
但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。
失败根源在于查询驱动的检索接口本身,将"路由--决定哪些事实必须保持可见"确立为核心开放问题。
A equipe de pesquisa lançou o benchmark InMind, que inclui 125 tarefas de validação de especialistas para testar a capacidade do sistema de memória do agen...
A equipe de pesquisa lançou o benchmark InMind, que inclui 125 tarefas de validação de especialistas
para testar a capacidade do sistema de memória do agente de lidar com associações implícitas. Quando memórias-chave são colocadas diretamente no contexto, o modelo backbone pode responder a 84,0% das consultas indiretas; Mas quando recuperado por seis sistemas de memória, a maior taxa de acerto foi de apenas 14,4%, embora esses sistemas pudessem alcançar 100% de precisão em recall direto. A raiz da falha está na própria interface de recuperação orientada por consultas, que estabelece o "roteamento — determinar quais fatos devem permanecer visíveis" como uma questão central em aberto.
研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。
当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;
但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。
失败根源在于查询驱动的检索接口本身,将"路由--决定哪些事实必须保持可见"确立为核心开放问题。
InMind 基准以 125 个专家验证任务评估智能体记忆系统的隐式关联能力。关键记忆直接进入上下文时,骨干模型对间接查询的回答率为 84.0%;经六种记忆系统检索时,最高命中率仅 14.4%。
材料显示,受测记忆系统的直接召回准确率最高可达 100%,但面对需要隐式关联的间接查询,检索表现明显下降。研究将问题指向查询驱动的检索接口,并提出应关注哪些事实需要持续可见。
Aioga 判断,这组结果提示:直接召回准确率不足以单独衡量智能体记忆系统的有效性。系统即使能够找到明确相关的信息,也可能无法识别完成间接查询所需的潜在关联。
该研究可能推动智能体记忆评估从直接匹配扩展到隐式关联与信息路由。值得关注的是,后续系统设计是否会把关键事实的持续可见性纳入检索接口,而非只优化查询与记忆的直接相似关系。 Aioga 判断,下一步应在更多任务中复核 InMind 所揭示的差距,并分别评估骨干模型、记忆检索和路由机制。研究还可围绕“哪些事实必须保持可见”设计对照实验,但材料未提供具体方案。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
Fonte: HuggingFace Daily Papers(社区热门论文)
原文链接: Abrir fonte original
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-27T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。