一项新研究揭示,个性化大语言模型普遍存在过度推断(OI)现象,即编造超出证据支持的用户属性。
在 MirageBench 基准测试中,12 个模型均有 35%-49% 的推断被判定为虚构(均值 41.6%)。
更关键的是,模型自我评估的 OI 与外部评测结果呈负相关(rho = -0.60),表明自我报告的可信度是误导性信号,外部验证才是更可靠的个性化基础。
Một nghiên cứu mới tiết lộ rằng các mô hình ngôn ngữ lớn cá nhân hóa phổ biến có hiện tượng suy đoán quá mức (OI), tức là bịa đặt các thuộc tính người dùng...
Một nghiên cứu mới tiết lộ rằng các mô hình ngôn ngữ lớn cá nhân hóa phổ biến có hiện tượng suy đoán
quá mức (OI), tức là bịa đặt các thuộc tính người dùng vượt quá bằng chứng hỗ trợ. Trong bài kiểm tra chuẩn MirageBench, 12 mô hình đều có 35%-49% suy đoán bị đánh giá là hư cấu (trung bình 41,6%). Quan trọng hơn, OI mà mô hình tự đánh giá có mối tương quan âm với kết quả đánh giá bên ngoài (rho = -0,60), cho thấy độ tin cậy từ báo cáo tự thân là tín hiệu gây hiểu nhầm, còn xác minh bên ngoài mới là cơ sở cá nhân hóa đáng tin cậy hơn.
一项新研究揭示,个性化大语言模型普遍存在过度推断(OI)现象,即编造超出证据支持的用户属性。
在 MirageBench 基准测试中,12 个模型均有 35%-49% 的推断被判定为虚构(均值 41.6%)。
更关键的是,模型自我评估的 OI 与外部评测结果呈负相关(rho = -0.60),表明自我报告的可信度是误导性信号,外部验证才是更可靠的个性化基础。
研究指出,个性化大语言模型会过度推断用户属性,即生成超出已有证据支持的画像信息。MirageBench 测试中的 12 个模型均出现这一现象。
材料将这种问题称为过度推断(OI)。在 MirageBench 基准测试中,12 个模型有 35%-49% 的推断被判定为虚构,平均比例为 41.6%。
Aioga 判断,这项研究最值得关注的并非只有虚构比例,还包括模型自我评估与外部评测呈负相关,说明自我报告不能直接充当可信依据。
Aioga 判断,依赖模型自行判断个性化推断是否可靠,可能产生误导。研究给出的 rho 为 -0.60,材料据此强调外部验证是更可靠的个性化基础。 Aioga 建议,后续关注该研究对过度推断的判定方法及外部验证机制,并在个性化应用评估中分别记录模型自我报告与外部评测结果。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
Nguồn: HuggingFace Daily Papers(社区热门论文)
原文链接: Mở nguồn gốc
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-08-05T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。