GAMUT вводит двухуровневую метаоценочную структуру, которая автоматически компилирует структурированные метаоценки требуемого контента в бинарный контрольн...
论文研究HuggingFace Daily Papers(社区热门论文)
Ежедневный обзор ИИ
GAMUT вводит двухуровневую метаоценочную структуру, которая автоматически компилирует
структурированные метаоценки требуемого контента в бинарный контрольный список, который может быть оценен LLM, для оценки фактической полноты длинного текстового контента. Бенчмарк включает 1,813 вопросов на основе реальных изображений носимых устройств, охватывающих 10 областей. Среди 14 моделей наивысший результат показала Gemini 3.1 Pro (58,7%), что указывает на высокую сложность данного бенчмарка.
Фрагмент оригинальной статьи
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
GAMUT вводит двухуровневую метаоценочную структуру, которая автоматически компилирует структурированные метаоценки требуемого контента в бинарный контрольн...