قدم GAMUT إطار تقييم مزدوج المستوى، حيث يقوم بتحويل التقييم الهيكلي للمحتوى المطلوب تلقائيًا إلى قائمة فحص ثنائية يمكن لنماذج اللغة الكبيرة تقييمها، وذلك ل...
论文研究HuggingFace Daily Papers(社区热门论文)
ملخص معلومات AI اليوم
قدم GAMUT إطار تقييم مزدوج المستوى، حيث يقوم بتحويل التقييم الهيكلي للمحتوى المطلوب تلقائيًا إلى
قائمة فحص ثنائية يمكن لنماذج اللغة الكبيرة تقييمها، وذلك لتقييم دقة الحقائق في توليد النصوص الطويلة. تحتوي المعايير على 1,813 سؤالًا مستندًا إلى صور أجهزة قابلة للارتداء حقيقية، يغطي 10 مجالات. من بين 14 نموذجًا، حصل Gemini 3.1 Pro على أعلى درجة (58.7%)، مما يشير إلى أن هذه المعايير تشكل تحديًا كبيرًا.
مقتطف من المقال الأصلي
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
قدم GAMUT إطار تقييم مزدوج المستوى، حيث يقوم بتحويل التقييم الهيكلي للمحتوى المطلوب تلقائيًا إلى قائمة فحص ثنائية يمكن لنماذج اللغة الكبيرة تقييمها، وذلك ل...