GAMUT introduce un quadro a doppio livello di meta-valutazione, che compila automaticamente il meta-punteggio strutturato del contenuto richiesto in una ch...
论文研究HuggingFace Daily Papers(社区热门论文)
Brief quotidiano sull’IA
GAMUT introduce un quadro a doppio livello di meta-valutazione, che compila automaticamente il
meta-punteggio strutturato del contenuto richiesto in una checklist binaria valutabile da LLM, utilizzata per valutare l'integrità fattuale della generazione di testi lunghi. Il benchmark comprende 1.813 domande basate su immagini indossabili reali, coprendo 10 domini. Tra 14 modelli, Gemini 3.1 Pro ha ottenuto il punteggio più alto (58,7%), indicando che questo benchmark è estremamente impegnativo.
Estratto dell’articolo originale
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
GAMUT introduce un quadro a doppio livello di meta-valutazione, che compila automaticamente il meta-punteggio strutturato del contenuto richiesto in una ch...