Die Forscher haben SetwiseEvalKit vorgestellt, ein Benchmark zur Bewertung von Dokumentensammlungen, das Szenarien mit kurzen und langen Texten abdeckt und...
论文研究HuggingFace Daily Papers(社区热门论文)
KI-Informationsbrief des Tages
Die Forscher haben SetwiseEvalKit vorgestellt, ein Benchmark zur Bewertung von Dokumentensammlungen,
das Szenarien mit kurzen und langen Texten abdeckt und rund 28.000 hochwertige Bewertungskriterien in einer dreistufigen, neun-dimensionalen Struktur enthält. Die Bewertung von 12 verschiedenen Re-Ranker-Modellen zeigt, dass die beste Methode eine Abdeckung von weniger als 45 % erreicht und die bereichsübergreifende Koordination zwischen den Dokumenten generell schwach ist. Darauf aufbauend wurde die trainingsfreie Methode Rubric4Setwise vorgeschlagen, die die Kriterien in Signals für die Auswahl von Sammlungen umwandelt und bei weniger Dokumenten und Suchrunden die beste nachgelagerte Generierungsleistung erzielt; sie ist die einzige Methode, die in beiden Szenarien den SOTA-Status beibehält.
Originaler Artikelauszug
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
Die Forscher haben SetwiseEvalKit vorgestellt, ein Benchmark zur Bewertung von Dokumentensammlungen, das Szenarien mit kurzen und langen Texten abdeckt und...