GAMUT memperkenalkan kerangka penilaian meta dua lapis, yang secara otomatis mengkompilasi penilaian meta terstruktur dari konten yang dibutuhkan menjadi d...
论文研究HuggingFace Daily Papers(社区热门论文)
Ringkasan intelijen AI hari ini
GAMUT memperkenalkan kerangka penilaian meta dua lapis, yang secara otomatis mengkompilasi penilaian
meta terstruktur dari konten yang dibutuhkan menjadi daftar periksa biner yang dapat dinilai oleh LLM, digunakan untuk mengevaluasi integritas fakta dalam teks panjang. Benchmark ini mencakup 1.813 pertanyaan berbasis gambar wearable nyata, mencakup 10 bidang. Dari 14 model, Gemini 3.1 Pro memperoleh skor tertinggi (58,7%), menunjukkan bahwa benchmark ini sangat menantang.
Kutipan artikel asli
arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.
GAMUT memperkenalkan kerangka penilaian meta dua lapis, yang secara otomatis mengkompilasi penilaian meta terstruktur dari konten yang dibutuhkan menjadi d...