ะแนนเมต้าเชิงโครงสร้างของเนื้อหาที่ต้องการให้อัตโนมัติเป็นรายการตรวจสอบแบบไบนารี่ที่สามารถประเมินโดย LLM สำหรับการประเมินความสมบูรณ์ของข้อเท็จจริงในข้อความยาว ชุดมาตรฐานประกอบด้วยคำถาม 1,813 ข้อที่อิงจากภาพสวมใส่จริง ครอบคลุม 10 สาขา ในบรรดา 14 โมเดล Gemini 3.1 Pro ทำคะแนนสูงที่สุด (58.7%) ซึ่งแสดงให้เห็นว่าชุดมาตรฐานนี้ท้าทายอย่างยิ่ง
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.

