{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-08-11T09:21:12.743Z","headline":"个性化幻觉：LLM 如何编造用户画像，以及为何自我监控会误导","description":"一项新研究揭示，个性化大语言模型普遍存在过度推断（OI）现象，即编造超出证据支持的用户属性。在 MirageBench 基准测试中，12 个模型均有 35%-49% 的推断被判定为虚构（均值 41.6%）。更关键的是，模型自我评估的 OI 与外部评测结果呈负相关（rho = -0.60），表明自我报告的可信度是误导性信号，外部验证才是更可靠的个性化基础。","url":"https://www.aioga.com/news/cmsgxbipf02reroxzm6rg0q4l/","mainEntityOfPage":"https://www.aioga.com/news/cmsgxbipf02reroxzm6rg0q4l/","datePublished":"2026-08-05T00:00:00.000Z","dateModified":"2026-08-05T00:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://arxiv.org/abs/2608.04570","https://aihot.virxact.com/items/cmsgxbipf02reroxzm6rg0q4l"],"canonicalUrl":"https://www.aioga.com/news/cmsgxbipf02reroxzm6rg0q4l/","directAnswer":{"@type":"Answer","text":"研究指出，个性化大语言模型会过度推断用户属性，即生成超出已有证据支持的画像信息。MirageBench 测试中的 12 个模型均出现这一现象。","url":"https://www.aioga.com/news/cmsgxbipf02reroxzm6rg0q4l/","dateCreated":"2026-08-05T00:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"arXiv source article","url":"https://arxiv.org/abs/2608.04570","datePublished":"2026-08-05T00:00:00.000Z","provider":{"@type":"Organization","name":"arXiv","url":"https://arxiv.org/abs/2608.04570"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmsgxbipf02reroxzm6rg0q4l","datePublished":"2026-08-05T00:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmsgxbipf02reroxzm6rg0q4l"}}],"aggregationSource":"HuggingFace Daily Papers（社区热门论文）","originalPublisher":{"name":"arXiv","url":"https://arxiv.org/abs/2608.04570"},"geoDeepAnswer":null,"article":{"id":"cmsgxbipf02reroxzm6rg0q4l","slug":"cmsgxbipf02reroxzm6rg0q4l","url":"https://www.aioga.com/news/cmsgxbipf02reroxzm6rg0q4l/","title":"个性化幻觉：LLM 如何编造用户画像，以及为何自我监控会误导","title_en":"The Personalization Mirage： How LLMs Fabricate User Profiles， and Why Self-Monitoring Misleads","summary":"一项新研究揭示，个性化大语言模型普遍存在过度推断（OI）现象，即编造超出证据支持的用户属性。在 MirageBench 基准测试中，12 个模型均有 35%-49% 的推断被判定为虚构（均值 41.6%）。更关键的是，模型自我评估的 OI 与外部评测结果呈负相关（rho = -0.60），表明自我报告的可信度是误导性信号，外部验证才是更可靠的个性化基础。","source":"HuggingFace Daily Papers（社区热门论文）","sourceUrl":"https://arxiv.org/abs/2608.04570","aiHotUrl":"https://aihot.virxact.com/items/cmsgxbipf02reroxzm6rg0q4l","publishedAt":"2026-08-05T00:00:00.000Z","category":"论文研究","score":80,"selected":true,"articleBody":["一项新研究揭示，个性化大语言模型普遍存在过度推断（OI）现象，即编造超出证据支持的用户属性。","在 MirageBench 基准测试中，12 个模型均有 35%-49% 的推断被判定为虚构（均值 41.6%）。","更关键的是，模型自我评估的 OI 与外部评测结果呈负相关（rho = -0.60），表明自我报告的可信度是误导性信号，外部验证才是更可靠的个性化基础。"],"articleImages":[],"mediaStatus":"none","articleBodyZh":["个性化幻觉：LLM 如何编造用户画像，以及为何自我监控会误导 这条更新来自 arxiv.org，发布时间为 2026-08-05，Aioga 保留原文入口以便核验。","摘要：一项新研究揭示，个性化大语言模型普遍存在过度推断（OI）现象，即编造超出证据支持的用户属性。在 MirageBench 基准测试中，12 个模型均有 35%-49% 的推断被判定为虚构（均值 41.6%）。更关键的是，模型自我评估的 OI 与外部评测结果呈负相关（rho = -0.60），表明自我报告的可信度是误导性信号，外部验证才是更可靠的个性化基础。","背景：材料将这种问题称为过度推断（OI）。在 MirageBench 基准测试中，12 个模型有 35%-49% 的推断被判定为虚构，平均比例为 41.6%。","Aioga 观察：Aioga 判断，这项研究最值得关注的并非只有虚构比例，还包括模型自我评估与外部评测呈负相关，说明自我报告不能直接充当可信依据。","影响与后续：Aioga 判断，依赖模型自行判断个性化推断是否可靠，可能产生误导。研究给出的 rho 为 -0.60，材料据此强调外部验证是更可靠的个性化基础。 Aioga 建议，后续关注该研究对过度推断的判定方法及外部验证机制，并在个性化应用评估中分别记录模型自我报告与外部评测结果。"],"translationStatus":"","bodyOrigin":"summary-fallback","editorial":{"summary":"研究指出，个性化大语言模型会过度推断用户属性，即生成超出已有证据支持的画像信息。MirageBench 测试中的 12 个模型均出现这一现象。","background":"材料将这种问题称为过度推断（OI）。在 MirageBench 基准测试中，12 个模型有 35%-49% 的推断被判定为虚构，平均比例为 41.6%。","viewpoint":"Aioga 判断，这项研究最值得关注的并非只有虚构比例，还包括模型自我评估与外部评测呈负相关，说明自我报告不能直接充当可信依据。","implications":"Aioga 判断，依赖模型自行判断个性化推断是否可靠，可能产生误导。研究给出的 rho 为 -0.60，材料据此强调外部验证是更可靠的个性化基础。","nextStep":"Aioga 建议，后续关注该研究对过度推断的判定方法及外部验证机制，并在个性化应用评估中分别记录模型自我报告与外部评测结果。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-08-06T03:33:53.880Z","sourceHash":"b528a6b7a4563c93","review":{"approved":true,"groundedness":97,"clarity":92,"duplicationRisk":38,"blockingIssues":[],"notes":["summary 与 background 对“12 个模型均出现过度推断”存在轻度信息重复，但分别承担概述和数据补充功能，不构成阻断问题。","“自我报告不能直接充当可信依据”是对负相关结果及来源材料结论的合理概括；“Aioga 判断”明确标示了观点属性。","nextStep 属于明确标示的编辑建议，并未冒充研究原始结论。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["论文研究","HuggingFace Daily Papers（社区热门论文）"],"translations":{"zh-CN":{"title":"个性化幻觉：LLM 如何编造用户画像，以及为何自我监控会误导","summary":"一项新研究揭示，个性化大语言模型普遍存在过度推断（OI）现象，即编造超出证据支持的用户属性。在 MirageBench 基准测试中，12 个模型均有 35%-49% 的推断被判定为虚构（均值 41.6%）。更关键的是，模型自我评估的 OI 与外部评测结果呈负相关（rho = -0.60），表明自我报告的可信度是误导性信号，外部验证才是更可靠的个性化基础。","category":"论文研究","source":"arXiv","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"个性化幻觉：LLM 如何编造用户画像，以及为何自我监控会误导 - Aioga AI资讯","description":"一项新研究揭示，个性化大语言模型普遍存在过度推断（OI）现象，即编造超出证据支持的用户属性。在 MirageBench 基准测试中，12 个模型均有 35%-49% 的推断被判定为虚构（均值 41.6%）。更关键的是，模型自我评估的 OI 与外部评测结果呈负相关（rho = -0.60），表明自我报告的可信度是误导性信号，外部验证才是更可靠的个性化基础。","url":"https://www.aioga.com/news/cmsgxbipf02reroxzm6rg0q4l/","articleBody":["个性化幻觉：LLM 如何编造用户画像，以及为何自我监控会误导 这条更新来自 arxiv.org，发布时间为 2026-08-05，Aioga 保留原文入口以便核验。","摘要：一项新研究揭示，个性化大语言模型普遍存在过度推断（OI）现象，即编造超出证据支持的用户属性。在 MirageBench 基准测试中，12 个模型均有 35%-49% 的推断被判定为虚构（均值 41.6%）。更关键的是，模型自我评估的 OI 与外部评测结果呈负相关（rho = -0.60），表明自我报告的可信度是误导性信号，外部验证才是更可靠的个性化基础。","背景：材料将这种问题称为过度推断（OI）。在 MirageBench 基准测试中，12 个模型有 35%-49% 的推断被判定为虚构，平均比例为 41.6%。","Aioga 观察：Aioga 判断，这项研究最值得关注的并非只有虚构比例，还包括模型自我评估与外部评测呈负相关，说明自我报告不能直接充当可信依据。","影响与后续：Aioga 判断，依赖模型自行判断个性化推断是否可靠，可能产生误导。研究给出的 rho 为 -0.60，材料据此强调外部验证是更可靠的个性化基础。 Aioga 建议，后续关注该研究对过度推断的判定方法及外部验证机制，并在个性化应用评估中分别记录模型自我报告与外部评测结果。"]},"en":{"title":"Personalized Hallucinations: How LLMs Fabricate User Profiles and Why Self-Monitoring Can Be Misleading","summary":"A new study reveals that personalized large language models generally exhibit an over-inference (OI) phenomenon, which means fabricating user attributes beyond what the evidence supports. In the MirageBench benchmark tests, all 12 models had 35%-49% of inferences judged to be fictitious (average 41.6%). More importantly, the models' self-assessed OI was negatively correlated with external evaluation results (rho = -0.60), indicating that self-reported reliability is a misleading signal, and external verification is a more reliable basis for personalization.","category":"Research","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Personalized Hallucinations: How LLMs Fabricate User Profiles and Why Self-Monitoring Can Be Misleading - Aioga AI News","description":"A new study reveals that personalized large language models generally exhibit an over-inference (OI) phenomenon, which means fabricating user attributes beyond what the evidence su...","url":"https://www.aioga.com/en/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:23:05.378Z","articleBody":["A new study reveals that personalized large language models commonly exhibit over-inference (OI), meaning they fabricate user attributes beyond what the evidence supports.","In the MirageBench benchmark test, all 12 models had 35%-49% of inferences judged as fabricated (average 41.6%).","More importantly, the models' self-assessed OI negatively correlated with external evaluation results (rho = -0.60), indicating that self-reported reliability is a misleading signal and external verification is a more reliable basis for personalization."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:01:22.756Z"},"ja":{"title":"パーソナライズされた幻覚：LLMはどのようにユーザーのプロフィールを作り上げるのか、そしてなぜ自己監視が誤解を招くのか","summary":"新しい研究により、パーソナライズされた大規模言語モデルには一般的に過剰推論（OI）現象が存在することが明らかになった。これは、証拠が支持する範囲を超えてユーザー属性を作り出すことを指す。MirageBench ベンチマークテストでは、12 のモデルすべてで推論の 35%-49% が虚偽と判定され（平均 41.6%）、さらに重要なことに、モデルの自己評価による OI は外部評価結果と負の相関（rho = -0.60）を示した。これは、自己報告の信頼性が誤解を招く信号であり、外部検証がより信頼できるパーソナライズの基盤であることを示している。","category":"論文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"パーソナライズされた幻覚：LLMはどのようにユーザーのプロフィールを作り上げるのか、そしてなぜ自己監視が誤解を招くのか - Aioga AIニュース","description":"新しい研究により、パーソナライズされた大規模言語モデルには一般的に過剰推論（OI）現象が存在することが明らかになった。これは、証拠が支持する範囲を超えてユーザー属性を作り出すことを指す。MirageBench ベンチマークテストでは、12 のモデルすべてで推論の 35%-49% が虚偽と判定され（平均 41.6%）、さらに重要なことに、モデルの自己評価による...","url":"https://www.aioga.com/ja/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:23:31.359Z","articleBody":["ある新しい研究は、パーソナライズされた大規模言語モデルには過度推論（OI）の現象が普遍的に存在することを明らかにした。これは、証拠で裏付けられた範囲を超えてユーザー属性を作り出すことを指す。","MirageBench ベンチマークテストでは、12 のモデルすべてで推論の 35%-49% が虚構と判定された（平均 41.6%）。","さらに重要なのは、モデルの自己評価による OI と外部評価の結果には負の相関がある（rho = -0.60）ことであり、自己報告の信頼性は誤解を招く信号であり、外部検証こそがより信頼できるパーソナライズの基盤であることを示している。"],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:01:24.211Z"},"ko":{"title":"개인화 환각: LLM이 어떻게 사용자 프로필을 만들어내며, 왜 자기 모니터링이 오해를 일으키는가","summary":"한 연구는 개인화된 대형 언어 모델이 과도한 추론(OI) 현상을 일반적으로 보인다는 사실을 밝혀냈는데, 이는 증거가 뒷받침하지 않는 사용자 속성을 만들어내는 것을 의미한다. MirageBench 벤치마크 테스트에서 12개의 모델 모두 추론의 35%-49%가 허구로 판정되었으며(평균 41.6%), 더 중요한 점은 모델의 자기 평가 OI가 외부 평가 결과와 음의 상관관계(rho = -0.60)를 보였다는 것이다. 이는 자기 보고 신뢰도가 오도 신호임을 나타내며, 외부 검증이 더 신뢰할 수 있는 개인화 기반임을 시사한다.","category":"연구","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"개인화 환각: LLM이 어떻게 사용자 프로필을 만들어내며, 왜 자기 모니터링이 오해를 일으키는가 - Aioga AI 뉴스","description":"한 연구는 개인화된 대형 언어 모델이 과도한 추론(OI) 현상을 일반적으로 보인다는 사실을 밝혀냈는데, 이는 증거가 뒷받침하지 않는 사용자 속성을 만들어내는 것을 의미한다. MirageBench 벤치마크 테스트에서 12개의 모델 모두 추론의 35%-49%가 허구로 판정되었으며(평균 41.6%), 더 중요한 점은 모델의 자...","url":"https://www.aioga.com/ko/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:24:37.721Z","articleBody":["한 새로운 연구는 개인화된 대형 언어 모델이 일반적으로 과도한 추론(OI) 현상을 겪고 있음을 밝혀냈으며, 이는 증거가 뒷받침하지 않는 사용자 속성을 만들어내는 것을 의미한다.","MirageBench 벤치마크 테스트에서 12개의 모델 모두 35%-49%의 추론이 허구로 판정되었으며(평균 41.6%),","더 중요한 것은, 모델의 자기 평가 OI와 외부 평가 결과가 음의 상관관계(rho = -0.60)를 보였다는 것으로, 이는 자기보고 신뢰도가 오도할 수 있는 신호임을 나타내며, 외부 검증이 더 신뢰할 수 있는 개인화 기반이라는 것을 의미한다."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:02:16.041Z"},"es":{"title":"Alucinaciones personalizadas: cómo los LLM inventan perfiles de usuario y por qué la auto-supervisión puede ser engañosa","summary":"Un nuevo estudio revela que los modelos de lenguaje grandes personalizados presentan comúnmente el fenómeno de inferencia excesiva (OI), es decir, la fabricación de atributos del usuario que van más allá de lo que la evidencia respalda. En la prueba de referencia MirageBench, los 12 modelos presentaron entre el 35% y el 49% de inferencias consideradas como ficticias (promedio 41,6%). Más importante aún, la OI autoevaluada por los modelos mostró una correlación negativa con los resultados de la evaluación externa (rho = -0,60), lo que indica que la confiabilidad de los informes propios es una señal engañosa, y la verificación externa es la base de personalización más confiable.","category":"Investigación","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Alucinaciones personalizadas: cómo los LLM inventan perfiles de usuario y por qué la auto-supervisión puede ser engañosa - Aioga Noticias de IA","description":"Un nuevo estudio revela que los modelos de lenguaje grandes personalizados presentan comúnmente el fenómeno de inferencia excesiva (OI), es decir, la fabricación de atributos del u...","url":"https://www.aioga.com/es/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:24:24.966Z","articleBody":["Un nuevo estudio revela que los modelos de lenguaje a gran escala personalizados presentan de manera general el fenómeno de inferencia excesiva (OI, por sus siglas en inglés), es decir, inventan atributos de los usuarios que van más allá de lo que la evidencia respalda.","En la prueba de referencia MirageBench, los 12 modelos tuvieron entre un 35% y un 49% de inferencias consideradas como ficticias (promedio 41,6%).","Más importante aún, la OI autoevaluada por los modelos se correlaciona negativamente con los resultados de la evaluación externa (rho = -0,60), lo que indica que la credibilidad del auto-reporte es una señal engañosa y que la verificación externa es una base más confiable para la personalización."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:02:17.112Z"},"fr":{"title":"Hallucinations personnalisées : comment les LLM inventent des profils d'utilisateurs et pourquoi l'auto-surveillance peut induire en erreur","summary":"Une nouvelle étude révèle que les grands modèles de langage personnalisés présentent généralement un phénomène de surinférence (OI), c’est-à-dire qu’ils inventent des attributs des utilisateurs au-delà des preuves disponibles. Dans le test de référence MirageBench, les inférences de 12 modèles ont été jugées fictives dans 35 % à 49 % des cas (moyenne de 41,6 %). Plus important encore, l’OI auto-évaluée par les modèles est négativement corrélée avec les résultats de l’évaluation externe (rho = -0,60), ce qui indique que la crédibilité auto-déclarée est un signal trompeur et que la vérification externe constitue une base plus fiable pour la personnalisation.","category":"Recherche","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Hallucinations personnalisées : comment les LLM inventent des profils d'utilisateurs et pourquoi l'auto-surveillance peut induire en erreur - Aioga Actualités IA","description":"Une nouvelle étude révèle que les grands modèles de langage personnalisés présentent généralement un phénomène de surinférence (OI), c’est-à-dire qu’ils inventent des attributs des...","url":"https://www.aioga.com/fr/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:25:30.403Z","articleBody":["Une nouvelle étude révèle que les modèles de langage de grande taille personnalisés présentent généralement un phénomène de sur-inférence (OI), c'est-à-dire l'invention d'attributs utilisateurs au-delà de ce que les preuves soutiennent.","Dans le test de référence MirageBench, les 12 modèles ont chacun vu 35 % à 49 % de leurs inférences qualifiées de fictives (moyenne de 41,6 %).","Plus important encore, l'OI auto-évalué par les modèles est négativement corrélé avec les résultats des évaluations externes (rho = -0,60), ce qui indique que la crédibilité auto-rapportée est un signal trompeur, et que la validation externe est une base plus fiable pour la personnalisation."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:03:00.703Z"},"de":{"title":"Personalisierte Illusionen: Wie LLMs Benutzerprofile erfinden und warum Selbstüberwachung irreführend sein kann","summary":"Eine neue Studie zeigt, dass bei personalisierten großen Sprachmodellen häufig das Phänomen der Überinferenz (OI) auftritt, das heißt, sie erfinden Nutzerattribute, die über die durch Beweise gestützten hinausgehen. Im MirageBench-Benchmarktest wurden bei 12 Modellen jeweils 35 % bis 49 % der Inferenzentscheidungen als erfunden bewertet (Durchschnitt 41,6 %). Noch entscheidender ist, dass die von den Modellen selbst bewertete OI negativ mit den externen Bewertungsergebnissen korreliert (rho = -0,60), was darauf hindeutet, dass die eigene Einschätzung nur ein irreführendes Signal ist, während eine externe Überprüfung eine verlässlichere Grundlage für Personalisierung darstellt.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Personalisierte Illusionen: Wie LLMs Benutzerprofile erfinden und warum Selbstüberwachung irreführend sein kann - Aioga KI-News","description":"Eine neue Studie zeigt, dass bei personalisierten großen Sprachmodellen häufig das Phänomen der Überinferenz (OI) auftritt, das heißt, sie erfinden Nutzerattribute, die über die du...","url":"https://www.aioga.com/de/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:25:34.765Z","articleBody":["Eine neue Studie zeigt, dass personalisierte große Sprachmodelle allgemein das Phänomen der Überinferenzen (OI) aufweisen, das heißt, sie erfinden Benutzerattribute, die über das durch Beweise Unterstützte hinausgehen.","Im MirageBench-Benchmark wurden bei allen 12 Modellen 35%-49% der Schlüsse als erfunden bewertet (Durchschnitt 41,6%).","Noch entscheidender ist, dass die Selbstbewertung der OI durch die Modelle negativ mit den Ergebnissen externer Bewertungen korreliert (rho = -0,60), was darauf hinweist, dass die selbst berichtete Glaubwürdigkeit ein irreführendes Signal ist und externe Verifikation eine zuverlässigere Grundlage für die Personalisierung darstellt."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:03:01.774Z"},"pt-BR":{"title":"Alucinações personalizadas: como os LLMs inventam perfis de usuários e por que a auto-monitorização é enganosa","summary":"Um novo estudo revela que os modelos de linguagem grandes personalizados apresentam de forma geral o fenômeno de inferência excessiva (OI), ou seja, inventam atributos de usuário que vão além do que as evidências podem sustentar. No teste de benchmark MirageBench, 12 modelos tiveram entre 35% e 49% das inferências consideradas fictícias (média de 41,6%). Mais importante, a OI autoavaliada pelos modelos se correlaciona negativamente com os resultados de avaliações externas (rho = -0,60), indicando que a confiabilidade autorrelatada é um sinal enganoso, enquanto a verificação externa é uma base personalizada mais confiável.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Alucinações personalizadas: como os LLMs inventam perfis de usuários e por que a auto-monitorização é enganosa - Aioga Notícias de IA","description":"Um novo estudo revela que os modelos de linguagem grandes personalizados apresentam de forma geral o fenômeno de inferência excessiva (OI), ou seja, inventam atributos de usuário q...","url":"https://www.aioga.com/pt-BR/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:26:21.703Z","articleBody":["Um novo estudo revelou que modelos de linguagem grandes personalizados apresentam de forma generalizada o fenômeno de inferência excessiva (OI), ou seja, a fabricação de atributos do usuário além do que as evidências suportam.","Nos testes de referência MirageBench, os 12 modelos tiveram entre 35% e 49% das inferências avaliadas como fictícias (média de 41,6%).","Mais importante, a autoavaliação de OI dos modelos mostrou correlação negativa com os resultados de avaliação externa (rho = -0,60), indicando que a confiabilidade relatada por eles próprios é um sinal enganoso, sendo a verificação externa uma base mais confiável para personalização."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:03:45.420Z"},"ru":{"title":"Персонализированные иллюзии: как LLM создают профили пользователей и почему самоконтроль может вводить в заблуждение","summary":"Новое исследование показывает, что в персонализированных больших языковых моделях часто встречается явление чрезмерного вывода (OI), то есть измышление пользовательских характеристик, превышающих данные, подтверждаемые доказательствами. В тестах индустриального стандарта MirageBench у 12 моделей от 35% до 49% выводов были признаны вымышленными (в среднем 41,6%). Еще более важно то, что самооценка OI моделью отрицательно коррелирует с внешними оценками (rho = -0,60), что указывает на то, что достоверность самоотчета является вводящим в заблуждение сигналом, а внешняя проверка является более надежной основой для персонализации.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Персонализированные иллюзии: как LLM создают профили пользователей и почему самоконтроль может вводить в заблуждение - Aioga Новости ИИ","description":"Новое исследование показывает, что в персонализированных больших языковых моделях часто встречается явление чрезмерного вывода (OI), то есть измышление пользовательских характерист...","url":"https://www.aioga.com/ru/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:26:35.594Z","articleBody":["Новое исследование показало, что персонализированные большие языковые модели часто демонстрируют явление чрезмерных умозаключений (OI), то есть придумывают характеристики пользователей, выходящие за пределы подтверждённых доказательствами данных.","В тестах по стандарту MirageBench у всех 12 моделей от 35% до 49% выводов были признаны вымышленными (среднее значение 41,6%).","Более важно, что самооценка моделей по OI отрицательно коррелировала с результатами внешней оценки (rho = -0,60), что показывает: достоверность саморепорта может быть вводящим в заблуждение сигналом, а внешняя проверка является более надёжной основой для персонализации."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:03:46.475Z"},"ar":{"title":"الهلاوس المخصصة: كيف يقوم نموذج اللغة الكبير بتأليف ملفات تعريف المستخدمين، ولماذا يمكن أن يضلل المراقبة الذاتية","summary":"كشفت دراسة جديدة أن نماذج اللغة الكبيرة المخصصة تظهر بشكل شائع ظاهرة الاستنتاج المفرط (OI)، وهي اختلاق خصائص المستخدم التي تتجاوز ما تدعمه الأدلة. في اختبار معيار MirageBench، تم اعتبار 35%-49% من الاستنتاجات في جميع النماذج الاثني عشر ملفقة (المتوسط 41.6%). والأهم من ذلك، كان هناك ارتباط سلبي بين تقييم النموذج الذاتي لـ OI ونتائج التقييم الخارجي (rho = -0.60)، مما يشير إلى أن الموثوقية التي يتم الإبلاغ عنها ذاتيًا تعتبر إشارة مضللة، بينما يُعد التحقق الخارجي أساسًا أكثر موثوقية للتخصيص.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"الهلاوس المخصصة: كيف يقوم نموذج اللغة الكبير بتأليف ملفات تعريف المستخدمين، ولماذا يمكن أن يضلل المراقبة الذاتية - Aioga أخبار الذكاء الاصطناعي","description":"كشفت دراسة جديدة أن نماذج اللغة الكبيرة المخصصة تظهر بشكل شائع ظاهرة الاستنتاج المفرط (OI)، وهي اختلاق خصائص المستخدم التي تتجاوز ما تدعمه الأدلة. في اختبار معيار MirageBench، تم ا...","url":"https://www.aioga.com/ar/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:27:39.820Z","articleBody":["كشفت دراسة جديدة أن نماذج اللغة الكبيرة المُخصصة تظهر بشكل عام ظاهرة الاستنتاج المفرط (OI)، أي اختلاق خصائص المستخدم التي تتجاوز ما تدعمه الأدلة.","في اختبار المعيار MirageBench، وُجد أن جميع النماذج الاثني عشر كان 35%-49% من استنتاجاتها تُعتبر مختلقة (المتوسط 41.6%).","والأهم من ذلك، أن تقييم الذات للـ OI من قبل النماذج يتسم بعلاقة سلبية مع نتائج التقييم الخارجي (rho = -0.60)، مما يشير إلى أن مصداقية التقارير الذاتية هي إشارة مضللة، وأن التحقق الخارجي هو الأساس الأكثر موثوقية للتخصيص."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:04:33.427Z"},"hi":{"title":"व्यक्तित्व भ्रामकता: LLM कैसे उपयोगकर्ता प्रोफाइल बनाता है, और आत्म-निरीक्षण क्यों भ्रमित कर सकता है","summary":"एक नए अध्ययन में पता चला कि व्यक्तिगत बड़े भाषा मॉडल में सामान्यतः अधिक अनुमान (OI) की घटना होती है, यानी वे ऐसे उपयोगकर्ता गुणों का निर्माण करते हैं जो प्रमाणों द्वारा समर्थित नहीं हैं। MirageBench बेंचमार्क में, 12 मॉडलों में से 35%-49% अनुमान को काल्पनिक पाया गया (औसत 41.6%)। और भी महत्वपूर्ण बात यह है कि मॉडल का आत्म-मूल्यांकन OI का बाहरी मूल्यांकन परिणामों के साथ नकारात्मक रूप से संबंधित था (rho = -0.60), यह दर्शाता है कि आत्म-रिपोर्ट की विश्वसनीयता भ्रामक संकेत है, जबकि बाहरी सत्यापन ही अधिक विश्वसनीय व्यक्तिगत आधार है।","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"व्यक्तित्व भ्रामकता: LLM कैसे उपयोगकर्ता प्रोफाइल बनाता है, और आत्म-निरीक्षण क्यों भ्रमित कर सकता है - Aioga AI समाचार","description":"एक नए अध्ययन में पता चला कि व्यक्तिगत बड़े भाषा मॉडल में सामान्यतः अधिक अनुमान (OI) की घटना होती है, यानी वे ऐसे उपयोगकर्ता गुणों का निर्माण करते हैं जो प्रमाणों द्वारा समर्थित नही...","url":"https://www.aioga.com/hi/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:27:39.734Z","articleBody":["एक नए अध्ययन से पता चला है कि व्यक्तिगत बड़े भाषा मॉडल में सामान्यतः अधिक अनुमान (OI) की समस्या होती है, यानी, उपयोगकर्ता गुणों को प्रमाणों के समर्थन से अधिक बनाकर बताना।","MirageBench बेंचमार्क परीक्षण में, 12 मॉडल में से 35%-49% अनुमान को काल्पनिक माना गया (औसत 41.6%)।","इससे भी महत्वपूर्ण, मॉडल द्वारा अपने आप किए गए OI का बाहरी मूल्यांकन परिणामों के साथ नकारात्मक सह-संबंध है (rho = -0.60), इससे पता चलता है कि आत्म-रिपोर्ट की विश्वसनीयता गुमराह करने वाला संकेत है, और बाहरी सत्यापन अधिक विश्वसनीय व्यक्तिगत आधार है।"],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:04:33.431Z"},"it":{"title":"Allucinazioni personalizzate: come LLM inventa i profili degli utenti e perché l'automonitoraggio può fuorviare","summary":"Uno studio recente rivela che nei modelli linguistici di grandi dimensioni personalizzati è comune il fenomeno della sovrainferenza (OI), ossia la creazione di attributi degli utenti al di là di quanto supportato dalle prove. Nei test benchmark MirageBench, in tutti e 12 i modelli il 35%-49% delle inferenze è stato giudicato inventato (media 41,6%). Ancora più importante, l'OI autovalutata dai modelli è correlata negativamente con i risultati delle valutazioni esterne (rho = -0,60), indicando che l'affidabilità delle autovalutazioni è un segnale fuorviante e che la verifica esterna rappresenta una base più affidabile per la personalizzazione.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Allucinazioni personalizzate: come LLM inventa i profili degli utenti e perché l'automonitoraggio può fuorviare - Aioga Notizie IA","description":"Uno studio recente rivela che nei modelli linguistici di grandi dimensioni personalizzati è comune il fenomeno della sovrainferenza (OI), ossia la creazione di attributi degli uten...","url":"https://www.aioga.com/it/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:28:43.798Z","articleBody":["Una nuova ricerca rivela che i modelli linguistici di grandi dimensioni personalizzati mostrano comunemente il fenomeno della sovrainferenza (OI), ovvero l'invenzione di attributi degli utenti che vanno oltre le prove a supporto.","Nel benchmark MirageBench, tutti e 12 i modelli hanno avuto tra il 35% e il 49% delle inferenze considerate inventate (media 41,6%).","Ancora più importante, la OI auto-valutata dai modelli è negativamente correlata con i risultati delle valutazioni esterne (rho = -0,60), indicando che l'affidabilità segnalata dal modello stesso è un segnale fuorviante, mentre la verifica esterna è una base più affidabile per la personalizzazione."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:05:23.991Z"},"nl":{"title":"Gepersonaliseerde illusies: hoe LLM's gebruikersprofielen verzinnen en waarom zelfmonitoring misleidend kan zijn","summary":"Een nieuw onderzoek onthult dat gepersonaliseerde grote taalmodellen algemeen een verschijnsel van overmatige inferentie (OI) vertonen, dat wil zeggen dat ze gebruikerskenmerken verzinnen die niet door bewijs worden ondersteund. In de MirageBench-benchmarktest werd bij alle 12 modellen 35%-49% van de inferenties als fictief beoordeeld (gemiddeld 41,6%). Nog belangrijker is dat de zelfbeoordeling van OI door de modellen negatief gecorreleerd is met de externe evaluatieresultaten (rho = -0,60), wat aangeeft dat zelfgerapporteerde betrouwbaarheid een misleidend signaal is, en externe verificatie een betrouwbaarder fundament voor personalisatie biedt.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Gepersonaliseerde illusies: hoe LLM's gebruikersprofielen verzinnen en waarom zelfmonitoring misleidend kan zijn - Aioga AI-nieuws","description":"Een nieuw onderzoek onthult dat gepersonaliseerde grote taalmodellen algemeen een verschijnsel van overmatige inferentie (OI) vertonen, dat wil zeggen dat ze gebruikerskenmerken ve...","url":"https://www.aioga.com/nl/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:28:37.144Z","articleBody":["Een nieuw onderzoek onthult dat gepersonaliseerde grote taalmodellen algemeen last hebben van overmatige inferentie (OI), dat wil zeggen het verzinnen van gebruikerskenmerken die verder gaan dan wat door bewijs wordt ondersteund.","In de MirageBench-benchmarktests werden 12 modellen beoordeeld, waarbij 35%-49% van de inferenties als fictief werd bestempeld (gemiddeld 41,6%).","Nog belangrijker is dat de zelfevaluatie van OI door het model negatief correleerde met de resultaten van externe beoordelingen (rho = -0,60), wat aangeeft dat zelfgerapporteerde betrouwbaarheid een misleidend signaal is en externe verificatie een betrouwbaardere basis voor personalisatie vormt."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:05:23.633Z"},"tr":{"title":"Kişiselleştirilmiş Halüsinasyonlar: LLM Kullanıcı Profillerini Nasıl Uydurur ve Neden Kendini İzleme Yanıltıcı Olur","summary":"Yeni bir araştırma, kişiselleştirilmiş büyük dil modellerinde yaygın olarak aşırı çıkarım (OI) olgusu olduğunu ortaya koydu; bu, kullanıcı özelliklerini kanıtlarla desteklenmeyen şekilde uydurma anlamına geliyor. MirageBench kıyaslama testinde, 12 modelin tamamında çıkarımların %35-%49'u uydurma olarak değerlendirildi (ortalama %41,6). Daha da önemlisi, modellerin kendi OI değerlendirmeleri ile dış değerlendirme sonuçları arasında negatif bir korelasyon vardı (rho = -0,60), bu da öz bildirim güvenilirliğinin yanıltıcı bir sinyal olduğunu ve dış doğrulamanın daha güvenilir bir kişiselleştirme temeli olduğunu gösteriyor.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Kişiselleştirilmiş Halüsinasyonlar: LLM Kullanıcı Profillerini Nasıl Uydurur ve Neden Kendini İzleme Yanıltıcı Olur - Aioga AI Haberleri","description":"Yeni bir araştırma, kişiselleştirilmiş büyük dil modellerinde yaygın olarak aşırı çıkarım (OI) olgusu olduğunu ortaya koydu; bu, kullanıcı özelliklerini kanıtlarla desteklenmeyen ş...","url":"https://www.aioga.com/tr/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:29:41.171Z","articleBody":["Yeni bir araştırma, kişiselleştirilmiş büyük dil modellerinde yaygın olarak aşırı çıkarım (OI) olgusu bulunduğunu ortaya koydu; yani kullanıcı özelliklerini kanıtların ötesinde uydurma eğilimi vardır.","MirageBench kıyaslama testinde, 12 modelin tümünde çıkarımların %35-49'u uydurma olarak değerlendirildi (ortalama %41,6).","Daha da önemlisi, modellerin kendi kendine değerlendirdiği OI ile dış değerlendirme sonuçları arasında negatif bir ilişki vardı (rho = -0,60), bu da kendi rapor ettikleri güvenilirliğin yanıltıcı bir sinyal olduğunu, dış doğrulamanın ise daha güvenilir bir kişiselleştirme temeli olduğunu göstermektedir."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:06:12.882Z"},"vi":{"title":"Ảo giác cá nhân hóa: LLM cách lập hồ sơ người dùng, và tại sao tự giám sát lại gây hiểu lầm","summary":"Một nghiên cứu mới tiết lộ rằng các mô hình ngôn ngữ lớn cá nhân hóa phổ biến có hiện tượng suy đoán quá mức (OI), tức là bịa đặt các thuộc tính người dùng vượt quá bằng chứng hỗ trợ. Trong bài kiểm tra chuẩn MirageBench, 12 mô hình đều có 35%-49% suy đoán bị đánh giá là hư cấu (trung bình 41,6%). Quan trọng hơn, OI mà mô hình tự đánh giá có mối tương quan âm với kết quả đánh giá bên ngoài (rho = -0,60), cho thấy độ tin cậy từ báo cáo tự thân là tín hiệu gây hiểu nhầm, còn xác minh bên ngoài mới là cơ sở cá nhân hóa đáng tin cậy hơn.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Ảo giác cá nhân hóa: LLM cách lập hồ sơ người dùng, và tại sao tự giám sát lại gây hiểu lầm - Tin tức AI Aioga","description":"Một nghiên cứu mới tiết lộ rằng các mô hình ngôn ngữ lớn cá nhân hóa phổ biến có hiện tượng suy đoán quá mức (OI), tức là bịa đặt các thuộc tính người dùng vượt quá bằng chứng hỗ t...","url":"https://www.aioga.com/vi/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:29:44.219Z","articleBody":["Một nghiên cứu mới tiết lộ rằng các mô hình ngôn ngữ lớn cá nhân hóa thường có hiện tượng suy đoán quá mức (OI), tức là bịa ra những thuộc tính người dùng vượt quá bằng chứng hỗ trợ.","Trong một bài kiểm tra chuẩn MirageBench, 12 mô hình đều có từ 35%-49% các suy đoán bị đánh giá là bịa đặt (trung bình 41,6%).","Quan trọng hơn, đánh giá OI tự thân của mô hình có tương quan âm với kết quả đánh giá bên ngoài (rho = -0,60), cho thấy độ tin cậy do tự báo cáo là tín hiệu gây hiểu lầm, xác thực bên ngoài mới là nền tảng cá nhân hóa đáng tin cậy hơn."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:06:12.733Z"},"id":{"title":"Ilusi yang Dipersonalisasi: Bagaimana LLM Membuat Profil Pengguna, dan Mengapa Pengawasan Diri Bisa Menyesatkan","summary":"Sebuah penelitian baru mengungkapkan bahwa model bahasa besar yang dipersonalisasi secara umum menunjukkan fenomena inferensi berlebihan (OI), yaitu menciptakan atribut pengguna yang melebihi bukti yang tersedia. Dalam pengujian benchmark MirageBench, 12 model semuanya memiliki 35%-49% inferensi yang dinilai fiktif (rata-rata 41,6%). Yang lebih penting, OI yang dinilai sendiri oleh model memiliki korelasi negatif dengan hasil evaluasi eksternal (rho = -0,60), menunjukkan bahwa kredibilitas yang dilaporkan sendiri adalah sinyal menyesatkan, dan verifikasi eksternal adalah dasar personalisasi yang lebih dapat diandalkan.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Ilusi yang Dipersonalisasi: Bagaimana LLM Membuat Profil Pengguna, dan Mengapa Pengawasan Diri Bisa Menyesatkan - Berita AI Aioga","description":"Sebuah penelitian baru mengungkapkan bahwa model bahasa besar yang dipersonalisasi secara umum menunjukkan fenomena inferensi berlebihan (OI), yaitu menciptakan atribut pengguna ya...","url":"https://www.aioga.com/id/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:30:40.347Z","articleBody":["Sebuah penelitian baru mengungkapkan bahwa model bahasa besar yang dipersonalisasi umumnya mengalami fenomena inferensi berlebihan (OI), yaitu membuat atribut pengguna yang melebihi dukungan bukti.","Dalam pengujian benchmark MirageBench, 12 model semuanya memiliki 35%-49% inferensi yang dinilai sebagai fiktif (rata-rata 41,6%).","Yang lebih penting, OI yang dievaluasi sendiri oleh model memiliki korelasi negatif dengan hasil penilaian eksternal (rho = -0,60), menunjukkan bahwa kepercayaan diri yang dilaporkan sendiri adalah sinyal yang menyesatkan, dan verifikasi eksternal adalah dasar personalisasi yang lebih dapat diandalkan."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:07:04.886Z"},"th":{"title":"ภาพลวงตาที่เป็นส่วนตัว: LLM สร้างโปรไฟล์ผู้ใช้อย่างไร และทำไมการตรวจสอบตนเองจึงทำให้เข้าใจผิด","summary":"งานวิจัยใหม่ได้เปิดเผยว่า โมเดลภาษาขนาดใหญ่ที่ปรับให้เหมาะกับบุคคลมักประสบกับปรากฏการณ์การสรุปเกินจริง (OI) ซึ่งหมายถึงการสร้างคุณลักษณะของผู้ใช้เกินกว่าหลักฐานสนับสนุน ในการทดสอบมาตรฐาน MirageBench พบว่าโมเดลทั้ง 12 ตัวมีการสรุปเกินจริงอยู่ระหว่าง 35%-49% ของทั้งหมด (ค่าเฉลี่ย 41.6%) สิ่งที่สำคัญกว่า คือ การประเมินตนเองของโมเดลเกี่ยวกับ OI มีความสัมพันธ์เชิงลบกับผลการประเมินจากภายนอก (rho = -0.60) ซึ่งบ่งชี้ว่าความน่าเชื่อถือจากการรายงานตนเองอาจเป็นสัญญาณที่ทำให้เข้าใจผิด การตรวจสอบจากภายนอกต่างหากจึงเป็นพื้นฐานการปรับบุคคลที่น่าเชื่อถือมากกว่า","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"ภาพลวงตาที่เป็นส่วนตัว: LLM สร้างโปรไฟล์ผู้ใช้อย่างไร และทำไมการตรวจสอบตนเองจึงทำให้เข้าใจผิด - ข่าว AI Aioga","description":"งานวิจัยใหม่ได้เปิดเผยว่า โมเดลภาษาขนาดใหญ่ที่ปรับให้เหมาะกับบุคคลมักประสบกับปรากฏการณ์การสรุปเกินจริง (OI) ซึ่งหมายถึงการสร้างคุณลักษณะของผู้ใช้เกินกว่าหลักฐานสนับสนุน ในการทดสอบม...","url":"https://www.aioga.com/th/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:30:51.677Z","articleBody":["งานวิจัยใหม่เผยให้เห็นว่าแบบจำลองภาษาขนาดใหญ่ที่ปรับตามบุคลิกภาพโดยเฉพาะมีปรากฏการณ์การสรุปเกินจริง (OI) อย่างแพร่หลาย ซึ่งหมายถึงการสร้างคุณลักษณะของผู้ใช้เกินกว่าหลักฐานสนับสนุน","ในการทดสอบมาตรฐาน MirageBench ทั้ง 12 โมเดลมีการสรุปที่ถูกตัดสินว่าเป็นเรื่องแต่งตั้งแต่ 35%-49% (ค่าเฉลี่ย 41.6%)","ที่สำคัญยิ่งกว่านั้น OI ที่โมเดลประเมินตนเองมีความสัมพันธ์เชิงลบกับผลการประเมินจากภายนอก (rho = -0.60) ซึ่งแสดงให้เห็นว่า ความน่าเชื่อถือที่รายงานด้วยตนเองเป็นสัญญาณที่ทำให้เข้าใจผิด การตรวจสอบจากภายนอกจึงเป็นพื้นฐานการปรับตามบุคลิกภาพที่เชื่อถือได้มากกว่า"],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:07:05.182Z"},"pl":{"title":"Spersonalizowane halucynacje: jak LLM tworzy profile użytkowników i dlaczego auto-monitoring może wprowadzać w błąd","summary":"Nowe badanie wykazało, że spersonalizowane duże modele językowe powszechnie wykazują zjawisko nadmiernych wniosków (OI), czyli wymyślania atrybutów użytkownika wykraczających poza dostępne dowody. W testach bazujących na benchmarku MirageBench 12 modeli miało od 35% do 49% wniosków uznanych za fikcyjne (średnio 41,6%). Co ważniejsze, samoocena OI modeli korelowała ujemnie z wynikami oceny zewnętrznej (rho = -0,60), co wskazuje, że wiarygodność samooceny jest mylącym sygnałem, a weryfikacja zewnętrzna stanowi bardziej niezawodną podstawę personalizacji.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Spersonalizowane halucynacje: jak LLM tworzy profile użytkowników i dlaczego auto-monitoring może wprowadzać w błąd - Aioga Wiadomości AI","description":"Nowe badanie wykazało, że spersonalizowane duże modele językowe powszechnie wykazują zjawisko nadmiernych wniosków (OI), czyli wymyślania atrybutów użytkownika wykraczających poza...","url":"https://www.aioga.com/pl/news/cmsgxbipf02reroxzm6rg0q4l/","contentTranslated":true,"sourceHash":"f3b47cf8007761c1","translatedAt":"2026-08-06T03:31:57.785Z","articleBody":["Nowe badanie ujawnia, że spersonalizowane duże modele językowe powszechnie wykazują zjawisko nadmiernego wnioskowania (OI), czyli tworzenia atrybutów użytkownika wykraczających poza dostępne dowody.","W teście porównawczym MirageBench wszystkie 12 modeli miało od 35% do 49% wniosków uznanych za fikcyjne (średnio 41,6%).","Co ważniejsze, samoocena OI przez modele wykazywała ujemną korelację z wynikami zewnętrznej oceny (rho = -0,60), co wskazuje, że samo zgłoszona wiarygodność jest mylącym sygnałem, a weryfikacja zewnętrzna stanowi bardziej niezawodną podstawę personalizacji."],"bodyTranslated":true,"bodySourceHash":"6405cfe8a6b64ad1","bodyTranslatedAt":"2026-08-08T12:07:58.172Z"}}}}