研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。
当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;
但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。
失败根源在于查询驱动的检索接口本身,将"路由--决定哪些事实必须保持可见"确立为核心开放问题。
研究チームはInMindベンチマークを発表しました。これには、エージェントの記憶システムが暗黙的連想を扱う能力をテストするための125の専門家による検証タスクが含まれています。 キーメモリを直接文脈に置くと、バックボーンモデルは間接クエリの84.0%に答えることができます。 しかし、6つのメモリシステムを通じ...
研究チームはInMindベンチマークを発表しました。
これには、エージェントの記憶システムが暗黙的連想を扱う能力をテストするための125の専門家による検証タスクが含まれています。 キーメモリを直接文脈に置くと、バックボーンモデルは間接クエリの84.0%に答えることができます。 しかし、6つのメモリシステムを通じて取得した場合、最も高い命中率はわずか14.4%でしたが、これらのシステムは直接呼び戻しにおいて100%の精度を達成できました。 失敗の根本はクエリ駆動の検索インターフェース自体にあり、「ルーティング—どの事実が可視化すべきかを判断すること」を未解決の核心課題として確立しています。
研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。
当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;
但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。
失败根源在于查询驱动的检索接口本身,将"路由--决定哪些事实必须保持可见"确立为核心开放问题。
InMind 基准以 125 个专家验证任务评估智能体记忆系统的隐式关联能力。关键记忆直接进入上下文时,骨干模型对间接查询的回答率为 84.0%;经六种记忆系统检索时,最高命中率仅 14.4%。
材料显示,受测记忆系统的直接召回准确率最高可达 100%,但面对需要隐式关联的间接查询,检索表现明显下降。研究将问题指向查询驱动的检索接口,并提出应关注哪些事实需要持续可见。
Aioga 判断,这组结果提示:直接召回准确率不足以单独衡量智能体记忆系统的有效性。系统即使能够找到明确相关的信息,也可能无法识别完成间接查询所需的潜在关联。
该研究可能推动智能体记忆评估从直接匹配扩展到隐式关联与信息路由。值得关注的是,后续系统设计是否会把关键事实的持续可见性纳入检索接口,而非只优化查询与记忆的直接相似关系。 Aioga 判断,下一步应在更多任务中复核 InMind 所揭示的差距,并分别评估骨干模型、记忆检索和路由机制。研究还可围绕“哪些事实必须保持可见”设计对照实验,但材料未提供具体方案。
取得元が提供するタイトル、要約、出典、元記事リンクを掲載しています。記事全文は転載していません。
取得経路: 要約集約 · 元ドメイン: arxiv.org
出典: HuggingFace Daily Papers(社区热门论文)
元記事: 元記事を開く
Aioga アーカイブ: 情報ページを開く
Content record: summary-fallback · Updated: 2026-07-27T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga は世界の AI 動向を集約し、確認と引用のため出典情報を保持します。