Исследователи предложили SetwiseEvalKit — эталон для оценки коллекций документов с тремя уровнями и девятью измерениями, охватывающий как короткие, так и д...
论文研究HuggingFace Daily Papers(社区热门论文)
Ежедневный обзор ИИ
Исследователи предложили SetwiseEvalKit — эталон для оценки коллекций документов с тремя уровнями и
девятью измерениями, охватывающий как короткие, так и длинные тексты, включающий около 28 тысяч высококачественных критериев оценки. Оценка 12 различных методов повторной сортировки показала, что у лучших методов коэффициент покрытия не превышает 45%, а координация между документами по измерениям в целом слаба. На основе этого была предложена методика без обучения Rubric4Setwise, которая преобразует критерии в сигналы выбора для коллекций и достигает оптимальной производительности в генерации на последующих этапах с меньшим количеством документов и раундов поиска, являясь единственным методом, поддерживающим SOTA в обоих сценариях.
Фрагмент оригинальной статьи
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Исследователи предложили SetwiseEvalKit — эталон для оценки коллекций документов с тремя уровнями и девятью измерениями, охватывающий как короткие, так и д...