GAMUT introduit un cadre de méta-évaluation en deux niveaux, compilant automatiquement les méta-évaluations structurées du contenu requis en une liste de c...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief IA du jour
GAMUT introduit un cadre de méta-évaluation en deux niveaux, compilant automatiquement les
méta-évaluations structurées du contenu requis en une liste de contrôle binaire pouvant être notée par LLM, pour évaluer l'exactitude factuelle des textes longs générés. Le benchmark comprend 1 813 questions basées sur de véritables images portables, couvrant 10 domaines. Parmi 14 modèles, Gemini 3.1 Pro obtient le meilleur score (58,7 %), ce qui montre que ce benchmark est extrêmement exigeant.
Article et notes de source
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
GAMUT introduit un cadre de méta-évaluation en deux niveaux, compilant automatiquement les méta-évaluations structurées du contenu requis en une liste de c...