GAMUT introduce un marco de puntuación meta de doble capa, que compila automáticamente la puntuación meta estructurada del contenido requerido en una lista...
论文研究HuggingFace Daily Papers(社区热门论文)
Resumen diario de inteligencia IA
GAMUT introduce un marco de puntuación meta de doble capa, que compila automáticamente la puntuación
meta estructurada del contenido requerido en una lista de verificación binaria que puede ser evaluada por LLM, utilizada para evaluar la integridad factual de la generación de textos largos. El benchmark incluye 1,813 preguntas basadas en imágenes de dispositivos portátiles reales, cubriendo 10 dominios. Entre 14 modelos, Gemini 3.1 Pro obtuvo la puntuación más alta (58.7%), lo que indica que este benchmark es extremadamente desafiante.
Artículo y notas de fuente
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
GAMUT introduce un marco de puntuación meta de doble capa, que compila automáticamente la puntuación meta estructurada del contenido requerido en una lista...