GAMUT ने डुअल-लेयर मेटा-स्कोरिंग ढांचा पेश किया, जो आवश्यक सामग्री की संरचित मेटा-स्कोरिंग को स्वचालित रूप से LLM के लिए आंका जाने योग्य बाइनरी जांच सूची म...
论文研究HuggingFace Daily Papers(社区热门论文)
आज का AI इंटेलिजेंस ब्रीफ
GAMUT ने डुअल-लेयर मेटा-स्कोरिंग ढांचा पेश किया, जो आवश्यक सामग्री की संरचित मेटा-स्कोरिंग को
स्वचालित रूप से LLM के लिए आंका जाने योग्य बाइनरी जांच सूची में संकलित करता है, जिसका उपयोग लंबी पाठ उत्पन्न करने की तथ्यपूर्ण पूर्णता का मूल्यांकन करने के लिए किया जाता है। बेंचमार्क में 1,813 वास्तविक पहनने योग्य छवियों पर आधारित प्रश्न शामिल हैं, जो 10 क्षेत्रों को कवर करते हैं। 14 मॉडलों में Gemini 3.1 Pro ने सबसे अधिक स्कोर (58.7%) प्राप्त किया, जो दर्शाता है कि यह बेंचमार्क अत्यंत चुनौतीपूर्ण है।
मूल लेख का अंश
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
GAMUT ने डुअल-लेयर मेटा-स्कोरिंग ढांचा पेश किया, जो आवश्यक सामग्री की संरचित मेटा-स्कोरिंग को स्वचालित रूप से LLM के लिए आंका जाने योग्य बाइनरी जांच सूची म...