GAMUT은 이중 메타 점수 프레임워크를 도입하여 필요한 콘텐츠의 구조화된 메타 점수를 LLM이 점수 매길 수 있는 이진 체크리스트로 자동 컴파일하여 긴 텍스트 생성의 사실적 완전성을 평가합니다. 벤치마크에는 실제 웨어러블 이미지 기반의 1,813개의 질문이 포함되며, 10개의...
论文研究HuggingFace Daily Papers(社区热门论文)
오늘의 AI 정보 요약
GAMUT은 이중 메타 점수 프레임워크를 도입하여 필요한 콘텐츠의 구조화된 메타 점수를 LLM이 점수 매길 수 있는 이진 체크리스트로 자동 컴파일하여 긴 텍스트 생성의 사실적
완전성을 평가합니다. 벤치마크에는 실제 웨어러블 이미지 기반의 1,813개의 질문이 포함되며, 10개의 영역을 다룹니다. 14개의 모델 중 Gemini 3.1 Pro가 가장 높은 점수(58.7%)를 기록하여 이 벤치마크가 매우 도전적임을 보여줍니다.
본문 및 출처 설명
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
GAMUT은 이중 메타 점수 프레임워크를 도입하여 필요한 콘텐츠의 구조화된 메타 점수를 LLM이 점수 매길 수 있는 이진 체크리스트로 자동 컴파일하여 긴 텍스트 생성의 사실적 완전성을 평가합니다. 벤치마크에는 실제 웨어러블 이미지 기반의 1,813개의 질문이 포함되며, 10개의...