wymaganych treści w binarną listę kontrolną ocenianą przez LLM, służącą do oceny zgodności faktów w generowanych długich tekstach. Benchmark obejmuje 1 813 pytań opartych na obrazach rzeczywistych urządzeń noszonych, obejmujących 10 dziedzin. Spośród 14 modeli Gemini 3.1 Pro uzyskał najwyższy wynik (58,7%), co wskazuje, że benchmark jest bardzo wymagający.
Fragment oryginalnego artykułu
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.