GAMUT führt einen zweistufigen Meta-Bewertungsrahmen ein, der die strukturierten Meta-Bewertungen des erforderlichen Inhalts automatisch in eine von LLM be...
论文研究HuggingFace Daily Papers(社区热门论文)
KI-Informationsbrief des Tages
GAMUT führt einen zweistufigen Meta-Bewertungsrahmen ein, der die strukturierten Meta-Bewertungen
des erforderlichen Inhalts automatisch in eine von LLM bewertbare binäre Checkliste übersetzt, um die faktische Vollständigkeit langformatiger Textgenerierung zu bewerten. Das Benchmark besteht aus 1.813 Fragen, die auf echten Wearable-Bildern basieren und 10 Bereiche abdecken. Unter 14 Modellen erzielte Gemini 3.1 Pro die höchste Punktzahl (58,7 %), was darauf hindeutet, dass dieses Benchmark äußerst herausfordernd ist.
Originaler Artikelauszug
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
GAMUT führt einen zweistufigen Meta-Bewertungsrahmen ein, der die strukturierten Meta-Bewertungen des erforderlichen Inhalts automatisch in eine von LLM be...