연구자들은 SetwiseEvalKit을 제안했으며, 이는 단문과 장문 시나리오를 포괄하고 약 28K개의 고품질 평가 기준을 포함한 3단계 9차원 문서 집합 평가 벤치마크이다. 12종의 재정렬기를 평가한 결과, 최상의 방법의 커버리지는 45%에도 미치지 못했으며, 문서 간 조정...
论文研究HuggingFace Daily Papers(社区热门论文)
오늘의 AI 정보 요약
연구자들은 SetwiseEvalKit을 제안했으며, 이는 단문과 장문 시나리오를 포괄하고 약 28K개의 고품질 평가 기준을 포함한 3단계 9차원 문서 집합 평가 벤치마크이다.
12종의 재정렬기를 평가한 결과, 최상의 방법의 커버리지는 45%에도 미치지 못했으며, 문서 간 조정 차원은 전반적으로 약했다. 이를 기반으로 제안된 학습 없는 방법 Rubric4Setwise는 기준을 집합 선택 신호로 변환하여 더 적은 문서와 검색 라운드에서 최적의 다운스트림 생성 성능을 달성했으며, 두 시나리오 모두에서 SOTA를 유지한 유일한 방법이다.
본문 및 출처 설명
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
연구자들은 SetwiseEvalKit을 제안했으며, 이는 단문과 장문 시나리오를 포괄하고 약 28K개의 고품질 평가 기준을 포함한 3단계 9차원 문서 집합 평가 벤치마크이다. 12종의 재정렬기를 평가한 결과, 최상의 방법의 커버리지는 45%에도 미치지 못했으며, 문서 간 조정...