研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。
当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;
但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。
失败根源在于查询驱动的检索接口本身,将"路由--决定哪些事实必须保持可见"确立为核心开放问题。
연구팀은 InMind 벤치마크를 발표했으며, 여기에는 에이전트의 메모리 시스템이 암묵적 연관을 처리하는 능력을 테스트하기 위한 125개의 전문가 검증 과제가 포함되어 있습니다. 핵심 기억을 맥락 속에 직접 배치할 때, 백본 모델은 간접 쿼리의 84.0%에 답할 수 있습니다; 하...
연구팀은 InMind 벤치마크를 발표했으며, 여기에는 에이전트의 메모리 시스템이 암묵적 연관을 처리하는 능력을 테스트하기 위한 125개의 전문가 검증 과제가 포함되어 있습니다.
핵심 기억을 맥락 속에 직접 배치할 때, 백본 모델은 간접 쿼리의 84.0%에 답할 수 있습니다; 하지만 6개의 메모리 시스템을 통해 검색했을 때 가장 높은 명중률은 14.4%에 불과했으며, 이 시스템들은 직접 호출에 100% 정확도를 달성할 수 있었습니다. 실패의 근본 원인은 쿼리 기반 검색 인터페이스 자체에 있으며, 이는 "라우팅—어떤 사실이 가시적으로 유지되어야 하는지 결정하는 것"을 핵심 미해결 문제로 설정한다.
研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。
当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;
但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。
失败根源在于查询驱动的检索接口本身,将"路由--决定哪些事实必须保持可见"确立为核心开放问题。
InMind 基准以 125 个专家验证任务评估智能体记忆系统的隐式关联能力。关键记忆直接进入上下文时,骨干模型对间接查询的回答率为 84.0%;经六种记忆系统检索时,最高命中率仅 14.4%。
材料显示,受测记忆系统的直接召回准确率最高可达 100%,但面对需要隐式关联的间接查询,检索表现明显下降。研究将问题指向查询驱动的检索接口,并提出应关注哪些事实需要持续可见。
Aioga 判断,这组结果提示:直接召回准确率不足以单独衡量智能体记忆系统的有效性。系统即使能够找到明确相关的信息,也可能无法识别完成间接查询所需的潜在关联。
该研究可能推动智能体记忆评估从直接匹配扩展到隐式关联与信息路由。值得关注的是,后续系统设计是否会把关键事实的持续可见性纳入检索接口,而非只优化查询与记忆的直接相似关系。 Aioga 判断,下一步应在更多任务中复核 InMind 所揭示的差距,并分别评估骨干模型、记忆检索和路由机制。研究还可围绕“哪些事实必须保持可见”设计对照实验,但材料未提供具体方案。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: arxiv.org
출처: HuggingFace Daily Papers(社区热门论文)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: summary-fallback · Updated: 2026-07-27T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.