美团LongCat推出LoHoSearch,一个基于762万实体维基百科知识图谱自动生成问题的搜索智能体基准,旨在解决BrowseComp等现有基准趋于饱和的问题。
在11个前沿模型测试中,最佳得分仅34.74%,远低于当前模型在BrowseComp上约90%的成绩;
上下文策略仅带来+6.8个百分点的提升。
该基准包含544道问题、11个领域,采用树与图结构,已开源。
Meituan LongCat, 7,62 milyon fiziksel Wikipedia bilgi grafiklerine dayanan ve otomatik olarak problem üreten LoHoSearch adlı bir arama ajanı kıyaslaması ba...
Meituan LongCat, 7,62 milyon fiziksel Wikipedia bilgi grafiklerine dayanan ve otomatik olarak
problem üreten LoHoSearch adlı bir arama ajanı kıyaslaması başlattı; bu kıyaslama, BrowseComp gibi mevcut kıyaslamaların doygunluğunu ele almayı amaçladı. 11 sınır model testi arasında en iyi puan sadece %34,74 idi; bu, mevcut modelin BrowseComp'taki yaklaşık %90 puanının çok altındaydı; Bağlamsal strateji sadece +6,8 puanlık bir iyileşme getirdi. Bu kıyaslama 544 soru ve 11 alan içerir, ağaç ve grafik yapısı kullanır ve açık kaynaklıdır.
美团LongCat推出LoHoSearch,一个基于762万实体维基百科知识图谱自动生成问题的搜索智能体基准,旨在解决BrowseComp等现有基准趋于饱和的问题。
在11个前沿模型测试中,最佳得分仅34.74%,远低于当前模型在BrowseComp上约90%的成绩;
上下文策略仅带来+6.8个百分点的提升。
该基准包含544道问题、11个领域,采用树与图结构,已开源。
美团LongCat发布搜索智能体基准LoHoSearch。该基准基于含762万实体的维基百科知识图谱自动生成问题,共收录544道题,覆盖11个领域,并采用树与图结构,目前已开源。
发布方称,LoHoSearch旨在应对BrowseComp等现有基准趋于饱和的问题。材料显示,当前模型在BrowseComp上的成绩约为90%,因此需要更具挑战性的搜索智能体评测。
Aioga判断,LoHoSearch的主要价值在于提供一组更难的搜索任务,并通过知识图谱及树、图结构组织问题。其能否成为通用评测标准,仍需更多公开测试与使用反馈验证。
在对11个前沿模型的测试中,最佳得分仅为34.74%;材料同时称,上下文策略只带来6.8个百分点提升。值得关注的是,该结果显示参测模型在这套题目上仍有较大提升空间。 后续可重点关注开源基准的题目生成与评测设置、不同模型在544道题和11个领域中的表现,以及更多测试能否复现最佳得分和上下文策略提升幅度。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: x.com
Kaynak: X:美团 LongCat (@Meituan_LongCat)
原文链接: Orijinal kaynağı aç
Aioga 归档: 查看情报页
Content record: social-summary · Updated: 2026-07-17T14:08:29.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。