{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T06:40:50.084Z","headline":"GAMUT：面向事实完整性的双层元评分基准","description":"GAMUT 引入双层元评分框架，将所需内容的结构化元评分自动编译为 LLM 可评分的二元检查清单，用于评估长文本生成的事实完整性。基准包含 1，813 个基于真实可穿戴图像的问题，覆盖 10 个领域。14 个模型中 Gemini 3.1 Pro 得分最高（58.7%），表明该基准极具挑战性。","url":"https://www.aioga.com/news/cmrvls9qh03jwbihbbbf7v6y0/","mainEntityOfPage":"https://www.aioga.com/news/cmrvls9qh03jwbihbbbf7v6y0/","datePublished":"2026-07-21T00:00:00.000Z","dateModified":"2026-07-21T00:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://arxiv.org/abs/2607.19322","https://aihot.virxact.com/items/cmrvls9qh03jwbihbbbf7v6y0"],"canonicalUrl":"https://www.aioga.com/news/cmrvls9qh03jwbihbbbf7v6y0/","directAnswer":{"@type":"Answer","text":"Aioga 编辑摘要：GAMUT 引入双层元评分框架，将所需内容的结构化元评分自动编译为 LLM 可评分的二元检查清单，用于评估长文本生成的事实完整性。 Aioga 将其归入「论文研究」方向，重点关注它对真实使用和行业竞争的影响。","url":"https://www.aioga.com/news/cmrvls9qh03jwbihbbbf7v6y0/","dateCreated":"2026-07-21T00:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"arXiv source article","url":"https://arxiv.org/abs/2607.19322","datePublished":"2026-07-21T00:00:00.000Z","provider":{"@type":"Organization","name":"arXiv","url":"https://arxiv.org/abs/2607.19322"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrvls9qh03jwbihbbbf7v6y0","datePublished":"2026-07-21T00:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrvls9qh03jwbihbbbf7v6y0"}}],"aggregationSource":"HuggingFace Daily Papers（社区热门论文）","originalPublisher":{"name":"arXiv","url":"https://arxiv.org/abs/2607.19322"},"article":{"id":"cmrvls9qh03jwbihbbbf7v6y0","slug":"cmrvls9qh03jwbihbbbf7v6y0","url":"https://www.aioga.com/news/cmrvls9qh03jwbihbbbf7v6y0/","title":"GAMUT：面向事实完整性的双层元评分基准","title_en":"Two-Level Meta-Rubrics for Evaluating Open-Ended Generation： GAMUT， a Benchmark for Factual Completeness","summary":"GAMUT 引入双层元评分框架，将所需内容的结构化元评分自动编译为 LLM 可评分的二元检查清单，用于评估长文本生成的事实完整性。基准包含 1，813 个基于真实可穿戴图像的问题，覆盖 10 个领域。14 个模型中 Gemini 3.1 Pro 得分最高（58.7%），表明该基准极具挑战性。","source":"HuggingFace Daily Papers（社区热门论文）","sourceUrl":"https://arxiv.org/abs/2607.19322","aiHotUrl":"https://aihot.virxact.com/items/cmrvls9qh03jwbihbbbf7v6y0","publishedAt":"2026-07-21T00:00:00.000Z","category":"论文研究","score":57,"selected":false,"articleBody":["arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.","Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs ：https://info.arxiv.org/labs/index.html."],"articleImages":[{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation.png","alt":"Simons Foundation","afterParagraph":1,"url":"/media/articles/cmrvls9qh03jwbihbbbf7v6y0/e2d7f38d62f5ca91.png"},{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation-international.png","alt":"Simons Foundation International","afterParagraph":1,"url":"/media/articles/cmrvls9qh03jwbihbbbf7v6y0/1d56e29c5557cbdc.png"}],"mediaStatus":"ok","articleBodyZh":["arXivLabs 是一个框架，允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。","有一个可以为 arXiv 社区增加价值的项目想法吗？了解更多关于 arXivLabs 的信息：https://info.arxiv.org/labs/index.html。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Aioga 编辑摘要：GAMUT 引入双层元评分框架，将所需内容的结构化元评分自动编译为 LLM 可评分的二元检查清单，用于评估长文本生成的事实完整性。 Aioga 将其归入「论文研究」方向，重点关注它对真实使用和行业竞争的影响。","background":"背景分析：模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断，单项指标领先不等于已经形成稳定采用。","viewpoint":"Aioga 判断：这条动态更适合作为行业观察信号，当前信息足以建立线索，但不足以推导长期结论。","implications":"影响分析：对相关团队而言，短期应先核对来源、可用范围和实际成本，再判断是否值得接入或跟进。","nextStep":"后续观察：继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。","evidenceRefs":["title","summary","articleBody"],"confidence":"medium","status":"published","aiGenerated":false,"autoApproved":true,"generatedBy":"rule-safe-fallback","generatedAt":"2026-07-23T06:49:19.092Z","sourceHash":"a1f1f8e883290f7e","validation":{"passed":true,"mode":"rule-safe-fallback","checks":["schema","length","source-attribution","no-html"]}},"tags":["论文研究","HuggingFace Daily Papers（社区热门论文）"],"translations":{"zh-CN":{"title":"GAMUT：面向事实完整性的双层元评分基准","summary":"GAMUT 引入双层元评分框架，将所需内容的结构化元评分自动编译为 LLM 可评分的二元检查清单，用于评估长文本生成的事实完整性。基准包含 1，813 个基于真实可穿戴图像的问题，覆盖 10 个领域。14 个模型中 Gemini 3.1 Pro 得分最高（58.7%），表明该基准极具挑战性。","category":"论文研究","source":"arXiv","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT：面向事实完整性的双层元评分基准 - Aioga AI资讯","description":"GAMUT 引入双层元评分框架，将所需内容的结构化元评分自动编译为 LLM 可评分的二元检查清单，用于评估长文本生成的事实完整性。基准包含 1，813 个基于真实可穿戴图像的问题，覆盖 10 个领域。14 个模型中 Gemini 3.1 Pro 得分最高（58.7%），表明该基准极具挑战性。","url":"https://www.aioga.com/news/cmrvls9qh03jwbihbbbf7v6y0/"},"en":{"title":"GAMUT: A Two-Level Meta-Evaluation Benchmark for Factual Completeness","summary":"GAMUT introduces a dual-layer meta-scoring framework that automatically compiles the structured meta-scores of the required content into a binary checklist that LLMs can score, used to evaluate the factual integrity of long text generation. The benchmark includes 1,813 questions based on real wearable images, covering 10 domains. Among 14 models, Gemini 3.1 Pro scored the highest (58.7%), indicating that this benchmark is extremely challenging.","category":"Research","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: A Two-Level Meta-Evaluation Benchmark for Factual Completeness - Aioga AI News","description":"GAMUT introduces a dual-layer meta-scoring framework that automatically compiles the structured meta-scores of the required content into a binary checklist that LLMs can score, use...","url":"https://www.aioga.com/en/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:41:49.588Z"},"ja":{"title":"GAMUT：事実の完全性を対象とした二層メタ評価ベンチマーク","summary":"GAMUT は二層メタ評価フレームワークを導入し、必要な内容の構造化メタ評価を LLM が評価可能な二元チェックリストに自動コンパイルして、長文生成の事実整合性を評価します。ベンチマークは、実際のウェアラブル画像に基づく 1,813 件の質問を含み、10 の分野を網羅しています。14 のモデルの中で Gemini 3.1 Pro が最も高いスコア（58.7%）を記録し、このベンチマークが非常に挑戦的であることを示しています。","category":"論文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT：事実の完全性を対象とした二層メタ評価ベンチマーク - Aioga AIニュース","description":"GAMUT は二層メタ評価フレームワークを導入し、必要な内容の構造化メタ評価を LLM が評価可能な二元チェックリストに自動コンパイルして、長文生成の事実整合性を評価します。ベンチマークは、実際のウェアラブル画像に基づく 1,813 件の質問を含み、10 の分野を網羅しています。14 のモデルの中で Gemini 3.1 Pro が最も高いスコア（58.7%...","url":"https://www.aioga.com/ja/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:41:57.039Z"},"ko":{"title":"GAMUT: 사실 완전성을 위한 이중 메타 평가 기준","summary":"GAMUT은 이중 메타 점수 프레임워크를 도입하여 필요한 콘텐츠의 구조화된 메타 점수를 LLM이 점수 매길 수 있는 이진 체크리스트로 자동 컴파일하여 긴 텍스트 생성의 사실적 완전성을 평가합니다. 벤치마크에는 실제 웨어러블 이미지 기반의 1,813개의 질문이 포함되며, 10개의 영역을 다룹니다. 14개의 모델 중 Gemini 3.1 Pro가 가장 높은 점수(58.7%)를 기록하여 이 벤치마크가 매우 도전적임을 보여줍니다.","category":"연구","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: 사실 완전성을 위한 이중 메타 평가 기준 - Aioga AI 뉴스","description":"GAMUT은 이중 메타 점수 프레임워크를 도입하여 필요한 콘텐츠의 구조화된 메타 점수를 LLM이 점수 매길 수 있는 이진 체크리스트로 자동 컴파일하여 긴 텍스트 생성의 사실적 완전성을 평가합니다. 벤치마크에는 실제 웨어러블 이미지 기반의 1,813개의 질문이 포함되며, 10개의 영역을 다룹니다. 14개의 모델 중 Gemi...","url":"https://www.aioga.com/ko/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:42:42.453Z"},"es":{"title":"GAMUT: Un referente de meta-evaluación de dos niveles orientado a la integridad factual","summary":"GAMUT introduce un marco de puntuación meta de doble capa, que compila automáticamente la puntuación meta estructurada del contenido requerido en una lista de verificación binaria que puede ser evaluada por LLM, utilizada para evaluar la integridad factual de la generación de textos largos. El benchmark incluye 1,813 preguntas basadas en imágenes de dispositivos portátiles reales, cubriendo 10 dominios. Entre 14 modelos, Gemini 3.1 Pro obtuvo la puntuación más alta (58.7%), lo que indica que este benchmark es extremadamente desafiante.","category":"Investigación","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: Un referente de meta-evaluación de dos niveles orientado a la integridad factual - Aioga Noticias de IA","description":"GAMUT introduce un marco de puntuación meta de doble capa, que compila automáticamente la puntuación meta estructurada del contenido requerido en una lista de verificación binaria...","url":"https://www.aioga.com/es/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:42:36.794Z"},"fr":{"title":"GAMUT : Banc d'évaluation à double niveau pour l'exhaustivité factuelle","summary":"GAMUT introduit un cadre de méta-évaluation en deux niveaux, compilant automatiquement les méta-évaluations structurées du contenu requis en une liste de contrôle binaire pouvant être notée par LLM, pour évaluer l'exactitude factuelle des textes longs générés. Le benchmark comprend 1 813 questions basées sur de véritables images portables, couvrant 10 domaines. Parmi 14 modèles, Gemini 3.1 Pro obtient le meilleur score (58,7 %), ce qui montre que ce benchmark est extrêmement exigeant.","category":"Recherche","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT : Banc d'évaluation à double niveau pour l'exhaustivité factuelle - Aioga Actualités IA","description":"GAMUT introduit un cadre de méta-évaluation en deux niveaux, compilant automatiquement les méta-évaluations structurées du contenu requis en une liste de contrôle binaire pouvant ê...","url":"https://www.aioga.com/fr/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:43:24.304Z"},"de":{"title":"GAMUT: Eine zweistufige Meta-Bewertungsbenchmark für faktische Vollständigkeit","summary":"GAMUT führt einen zweistufigen Meta-Bewertungsrahmen ein, der die strukturierten Meta-Bewertungen des erforderlichen Inhalts automatisch in eine von LLM bewertbare binäre Checkliste übersetzt, um die faktische Vollständigkeit langformatiger Textgenerierung zu bewerten. Das Benchmark besteht aus 1.813 Fragen, die auf echten Wearable-Bildern basieren und 10 Bereiche abdecken. Unter 14 Modellen erzielte Gemini 3.1 Pro die höchste Punktzahl (58,7 %), was darauf hindeutet, dass dieses Benchmark äußerst herausfordernd ist.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: Eine zweistufige Meta-Bewertungsbenchmark für faktische Vollständigkeit - Aioga KI-News","description":"GAMUT führt einen zweistufigen Meta-Bewertungsrahmen ein, der die strukturierten Meta-Bewertungen des erforderlichen Inhalts automatisch in eine von LLM bewertbare binäre Checklist...","url":"https://www.aioga.com/de/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:43:20.828Z"},"pt-BR":{"title":"GAMUT: Um benchmark de meta-avaliação em duas camadas voltado para a integridade factual","summary":"GAMUT introduz a estrutura de meta-avaliação em duas camadas, compilando automaticamente as meta-avaliações estruturadas do conteúdo necessário em uma lista de verificação binária que pode ser avaliada por LLMs, usada para avaliar a integridade factual de gerações de texto longo. O benchmark contém 1.813 perguntas baseadas em imagens reais de dispositivos vestíveis, cobrindo 10 áreas. Entre 14 modelos, o Gemini 3.1 Pro obteve a maior pontuação (58,7%), indicando que este benchmark é extremamente desafiador.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: Um benchmark de meta-avaliação em duas camadas voltado para a integridade factual - Aioga Notícias de IA","description":"GAMUT introduz a estrutura de meta-avaliação em duas camadas, compilando automaticamente as meta-avaliações estruturadas do conteúdo necessário em uma lista de verificação binária...","url":"https://www.aioga.com/pt-BR/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:44:05.634Z"},"ru":{"title":"GAMUT: Двухуровневая метаоценочная база для полноты фактической информации","summary":"GAMUT вводит двухуровневую метаоценочную структуру, которая автоматически компилирует структурированные метаоценки требуемого контента в бинарный контрольный список, который может быть оценен LLM, для оценки фактической полноты длинного текстового контента. Бенчмарк включает 1,813 вопросов на основе реальных изображений носимых устройств, охватывающих 10 областей. Среди 14 моделей наивысший результат показала Gemini 3.1 Pro (58,7%), что указывает на высокую сложность данного бенчмарка.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: Двухуровневая метаоценочная база для полноты фактической информации - Aioga Новости ИИ","description":"GAMUT вводит двухуровневую метаоценочную структуру, которая автоматически компилирует структурированные метаоценки требуемого контента в бинарный контрольный список, который может...","url":"https://www.aioga.com/ru/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:44:06.030Z"},"ar":{"title":"GAMUT: معيار تقييم مزدوج المستوى موجه نحو اكتمال الحقائق","summary":"قدم GAMUT إطار تقييم مزدوج المستوى، حيث يقوم بتحويل التقييم الهيكلي للمحتوى المطلوب تلقائيًا إلى قائمة فحص ثنائية يمكن لنماذج اللغة الكبيرة تقييمها، وذلك لتقييم دقة الحقائق في توليد النصوص الطويلة. تحتوي المعايير على 1,813 سؤالًا مستندًا إلى صور أجهزة قابلة للارتداء حقيقية، يغطي 10 مجالات. من بين 14 نموذجًا، حصل Gemini 3.1 Pro على أعلى درجة (58.7%)، مما يشير إلى أن هذه المعايير تشكل تحديًا كبيرًا.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: معيار تقييم مزدوج المستوى موجه نحو اكتمال الحقائق - Aioga أخبار الذكاء الاصطناعي","description":"قدم GAMUT إطار تقييم مزدوج المستوى، حيث يقوم بتحويل التقييم الهيكلي للمحتوى المطلوب تلقائيًا إلى قائمة فحص ثنائية يمكن لنماذج اللغة الكبيرة تقييمها، وذلك لتقييم دقة الحقائق في تولي...","url":"https://www.aioga.com/ar/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:44:49.595Z"},"hi":{"title":"GAMUT：सत्यता की पूर्णता के लिए दो-स्तरीय मेटा-रेटिंग मानक","summary":"GAMUT ने डुअल-लेयर मेटा-स्कोरिंग ढांचा पेश किया, जो आवश्यक सामग्री की संरचित मेटा-स्कोरिंग को स्वचालित रूप से LLM के लिए आंका जाने योग्य बाइनरी जांच सूची में संकलित करता है, जिसका उपयोग लंबी पाठ उत्पन्न करने की तथ्यपूर्ण पूर्णता का मूल्यांकन करने के लिए किया जाता है। बेंचमार्क में 1,813 वास्तविक पहनने योग्य छवियों पर आधारित प्रश्न शामिल हैं, जो 10 क्षेत्रों को कवर करते हैं। 14 मॉडलों में Gemini 3.1 Pro ने सबसे अधिक स्कोर (58.7%) प्राप्त किया, जो दर्शाता है कि यह बेंचमार्क अत्यंत चुनौतीपूर्ण है।","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT：सत्यता की पूर्णता के लिए दो-स्तरीय मेटा-रेटिंग मानक - Aioga AI समाचार","description":"GAMUT ने डुअल-लेयर मेटा-स्कोरिंग ढांचा पेश किया, जो आवश्यक सामग्री की संरचित मेटा-स्कोरिंग को स्वचालित रूप से LLM के लिए आंका जाने योग्य बाइनरी जांच सूची में संकलित करता है, जिसका...","url":"https://www.aioga.com/hi/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:44:52.508Z"},"it":{"title":"GAMUT: Un benchmark a doppio livello per la valutazione della completezza dei fatti","summary":"GAMUT introduce un quadro a doppio livello di meta-valutazione, che compila automaticamente il meta-punteggio strutturato del contenuto richiesto in una checklist binaria valutabile da LLM, utilizzata per valutare l'integrità fattuale della generazione di testi lunghi. Il benchmark comprende 1.813 domande basate su immagini indossabili reali, coprendo 10 domini. Tra 14 modelli, Gemini 3.1 Pro ha ottenuto il punteggio più alto (58,7%), indicando che questo benchmark è estremamente impegnativo.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: Un benchmark a doppio livello per la valutazione della completezza dei fatti - Aioga Notizie IA","description":"GAMUT introduce un quadro a doppio livello di meta-valutazione, che compila automaticamente il meta-punteggio strutturato del contenuto richiesto in una checklist binaria valutabil...","url":"https://www.aioga.com/it/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:45:34.937Z"},"nl":{"title":"GAMUT: Een tweelaags meta-beoordelingsbenchmarkt gericht op feitelijke volledigheid","summary":"GAMUT introduceert een tweelaags meta-score framework, dat de gestructureerde meta-scores van de vereiste inhoud automatisch compileert tot een binaire checklist die door LLM kan worden beoordeeld, ter evaluatie van de feitelijke volledigheid van lange tekstgeneratie. De benchmark bevat 1.813 vragen gebaseerd op echte draagbare afbeeldingen, die 10 domeinen beslaan. Van de 14 modellen behaalde Gemini 3.1 Pro de hoogste score (58,7%), wat aangeeft dat deze benchmark zeer uitdagend is.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: Een tweelaags meta-beoordelingsbenchmarkt gericht op feitelijke volledigheid - Aioga AI-nieuws","description":"GAMUT introduceert een tweelaags meta-score framework, dat de gestructureerde meta-scores van de vereiste inhoud automatisch compileert tot een binaire checklist die door LLM kan w...","url":"https://www.aioga.com/nl/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:45:32.287Z"},"tr":{"title":"GAMUT: Gerçeklik Bütünlüğüne Yönelik Çift Katmanlı Meta Puanlama Ölçeği","summary":"GAMUT, gerekli içeriğin yapılandırılmış meta puanlamasını LLM tarafından değerlendirilebilecek ikili kontrol listesini otomatik olarak derleyen çift katmanlı bir meta puanlama çerçevesi sunar ve uzun metin üretiminin gerçek bütünlüğünü değerlendirmek için kullanılır. Kıyaslama, 10 alanı kapsayan 1.813 gerçek giyilebilir görüntüye dayalı soruyu içerir. 14 model arasında Gemini 3.1 Pro en yüksek puanı aldı (%58,7), bu da kıyaslamanın oldukça zorlayıcı olduğunu göstermektedir.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: Gerçeklik Bütünlüğüne Yönelik Çift Katmanlı Meta Puanlama Ölçeği - Aioga AI Haberleri","description":"GAMUT, gerekli içeriğin yapılandırılmış meta puanlamasını LLM tarafından değerlendirilebilecek ikili kontrol listesini otomatik olarak derleyen çift katmanlı bir meta puanlama çerç...","url":"https://www.aioga.com/tr/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:46:14.980Z"},"vi":{"title":"GAMUT: Tiêu chuẩn đánh giá hai lớp hướng tới tính đầy đủ của sự thật","summary":"GAMUT giới thiệu khung đánh giá meta hai lớp, tự động biên dịch các đánh giá meta có cấu trúc của nội dung cần thiết thành danh sách kiểm tra nhị phân có thể được LLM chấm điểm, dùng để đánh giá tính đầy đủ về sự thật của các văn bản dài được tạo ra. Bộ chuẩn bao gồm 1.813 câu hỏi dựa trên hình ảnh thiết bị đeo thực tế, bao phủ 10 lĩnh vực. Trong 14 mô hình, Gemini 3.1 Pro đạt điểm cao nhất (58,7%), cho thấy bộ chuẩn này có tính thách thức rất cao.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: Tiêu chuẩn đánh giá hai lớp hướng tới tính đầy đủ của sự thật - Tin tức AI Aioga","description":"GAMUT giới thiệu khung đánh giá meta hai lớp, tự động biên dịch các đánh giá meta có cấu trúc của nội dung cần thiết thành danh sách kiểm tra nhị phân có thể được LLM chấm điểm, dù...","url":"https://www.aioga.com/vi/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:46:15.608Z"},"id":{"title":"GAMUT: Tolok Ukur Penilaian Meta Dua Lapis untuk Kelengkapan Fakta","summary":"GAMUT memperkenalkan kerangka penilaian meta dua lapis, yang secara otomatis mengkompilasi penilaian meta terstruktur dari konten yang dibutuhkan menjadi daftar periksa biner yang dapat dinilai oleh LLM, digunakan untuk mengevaluasi integritas fakta dalam teks panjang. Benchmark ini mencakup 1.813 pertanyaan berbasis gambar wearable nyata, mencakup 10 bidang. Dari 14 model, Gemini 3.1 Pro memperoleh skor tertinggi (58,7%), menunjukkan bahwa benchmark ini sangat menantang.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: Tolok Ukur Penilaian Meta Dua Lapis untuk Kelengkapan Fakta - Berita AI Aioga","description":"GAMUT memperkenalkan kerangka penilaian meta dua lapis, yang secara otomatis mengkompilasi penilaian meta terstruktur dari konten yang dibutuhkan menjadi daftar periksa biner yang...","url":"https://www.aioga.com/id/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:47:03.251Z"},"th":{"title":"GAMUT: มาตรฐานการให้คะแนนสองชั้นสำหรับความครบถ้วนของข้อเท็จจริง","summary":"GAMUT นำเสนอกรอบการให้คะแนนเมต้าสองชั้น โดยจะแปลงการให้คะแนนเมต้าเชิงโครงสร้างของเนื้อหาที่ต้องการให้อัตโนมัติเป็นรายการตรวจสอบแบบไบนารี่ที่สามารถประเมินโดย LLM สำหรับการประเมินความสมบูรณ์ของข้อเท็จจริงในข้อความยาว ชุดมาตรฐานประกอบด้วยคำถาม 1,813 ข้อที่อิงจากภาพสวมใส่จริง ครอบคลุม 10 สาขา ในบรรดา 14 โมเดล Gemini 3.1 Pro ทำคะแนนสูงที่สุด (58.7%) ซึ่งแสดงให้เห็นว่าชุดมาตรฐานนี้ท้าทายอย่างยิ่ง","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: มาตรฐานการให้คะแนนสองชั้นสำหรับความครบถ้วนของข้อเท็จจริง - ข่าว AI Aioga","description":"GAMUT นำเสนอกรอบการให้คะแนนเมต้าสองชั้น โดยจะแปลงการให้คะแนนเมต้าเชิงโครงสร้างของเนื้อหาที่ต้องการให้อัตโนมัติเป็นรายการตรวจสอบแบบไบนารี่ที่สามารถประเมินโดย LLM สำหรับการประเมินควา...","url":"https://www.aioga.com/th/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:47:07.536Z"},"pl":{"title":"GAMUT: Dwuwarstwowa metryka oceny ukierunkowana na pełność faktów","summary":"GAMUT wprowadza dwuwarstwowy framework oceny meta, automatycznie kompilując strukturalne meta-oceny wymaganych treści w binarną listę kontrolną ocenianą przez LLM, służącą do oceny zgodności faktów w generowanych długich tekstach. Benchmark obejmuje 1 813 pytań opartych na obrazach rzeczywistych urządzeń noszonych, obejmujących 10 dziedzin. Spośród 14 modeli Gemini 3.1 Pro uzyskał najwyższy wynik (58,7%), co wskazuje, że benchmark jest bardzo wymagający.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"GAMUT: Dwuwarstwowa metryka oceny ukierunkowana na pełność faktów - Aioga Wiadomości AI","description":"GAMUT wprowadza dwuwarstwowy framework oceny meta, automatycznie kompilując strukturalne meta-oceny wymaganych treści w binarną listę kontrolną ocenianą przez LLM, służącą do oceny...","url":"https://www.aioga.com/pl/news/cmrvls9qh03jwbihbbbf7v6y0/","contentTranslated":true,"sourceHash":"089acbdeb3e485c0","translatedAt":"2026-07-23T00:47:53.461Z"}}}}