GAMUT introduz a estrutura de meta-avaliação em duas camadas, compilando automaticamente as meta-avaliações estruturadas do conteúdo necessário em uma list...
论文研究HuggingFace Daily Papers(社区热门论文)
Resumo diário de inteligência em IA
GAMUT introduz a estrutura de meta-avaliação em duas camadas, compilando automaticamente as
meta-avaliações estruturadas do conteúdo necessário em uma lista de verificação binária que pode ser avaliada por LLMs, usada para avaliar a integridade factual de gerações de texto longo. O benchmark contém 1.813 perguntas baseadas em imagens reais de dispositivos vestíveis, cobrindo 10 áreas. Entre 14 modelos, o Gemini 3.1 Pro obteve a maior pontuação (58,7%), indicando que este benchmark é extremamente desafiador.
Trecho do artigo original
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
GAMUT introduz a estrutura de meta-avaliação em duas camadas, compilando automaticamente as meta-avaliações estruturadas do conteúdo necessário em uma list...