美团LongCat推出LoHoSearch,一个基于762万实体维基百科知识图谱自动生成问题的搜索智能体基准,旨在解决BrowseComp等现有基准趋于饱和的问题。
在11个前沿模型测试中,最佳得分仅34.74%,远低于当前模型在BrowseComp上约90%的成绩;
上下文策略仅带来+6.8个百分点的提升。
该基准包含544道问题、11个领域,采用树与图结构,已开源。
메이투안 LongCat은 LoHoSearch를 출시했습니다. 이는 762만 개 엔티티 위키백과 지식 그래프를 기반으로 자동 생성된 질문을 사용하는 검색 지능 에이전트 벤치마크로, BrowseComp 등 기존 벤치마크가 포화 상태에 이르는 문제를 해결하는 것을 목표로 합니다. 1...
메이투안 LongCat은 LoHoSearch를 출시했습니다. 이는 762만 개 엔티티 위키백과 지식 그래프를 기반으로 자동 생성된 질문을 사용하는 검색 지능 에이전트 벤치마크로,
BrowseComp 등 기존 벤치마크가 포화 상태에 이르는 문제를 해결하는 것을 목표로 합니다. 11개의 최첨단 모델 테스트에서 최고 점수는 단 34.74%로, 현재 모델이 BrowseComp에서 기록하는 약 90%의 성적에 비해 훨씬 낮습니다. 문맥 전략은 단 6.8 포인트 향상에 그쳤습니다. 이 벤치마크는 544개의 질문과 11개의 분야를 포함하며, 트리 및 그래프 구조를 사용하고 있으며, 오픈소스로 공개되어 있습니다.
美团LongCat推出LoHoSearch,一个基于762万实体维基百科知识图谱自动生成问题的搜索智能体基准,旨在解决BrowseComp等现有基准趋于饱和的问题。
在11个前沿模型测试中,最佳得分仅34.74%,远低于当前模型在BrowseComp上约90%的成绩;
上下文策略仅带来+6.8个百分点的提升。
该基准包含544道问题、11个领域,采用树与图结构,已开源。
美团LongCat发布搜索智能体基准LoHoSearch。该基准基于含762万实体的维基百科知识图谱自动生成问题,共收录544道题,覆盖11个领域,并采用树与图结构,目前已开源。
发布方称,LoHoSearch旨在应对BrowseComp等现有基准趋于饱和的问题。材料显示,当前模型在BrowseComp上的成绩约为90%,因此需要更具挑战性的搜索智能体评测。
Aioga判断,LoHoSearch的主要价值在于提供一组更难的搜索任务,并通过知识图谱及树、图结构组织问题。其能否成为通用评测标准,仍需更多公开测试与使用反馈验证。
在对11个前沿模型的测试中,最佳得分仅为34.74%;材料同时称,上下文策略只带来6.8个百分点提升。值得关注的是,该结果显示参测模型在这套题目上仍有较大提升空间。 后续可重点关注开源基准的题目生成与评测设置、不同模型在544道题和11个领域中的表现,以及更多测试能否复现最佳得分和上下文策略提升幅度。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: x.com
출처: X:美团 LongCat (@Meituan_LongCat)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: social-summary · Updated: 2026-07-17T14:08:29.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.