Aioga
AI资讯 / 行业动态
返回 AI资讯

LLM 分类就是特征工程:用逻辑回归包装 LLM 判定

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-18T08:08:34.000Z热度 58

作者提出 LLM 直接当分类器缺乏校准和可解释性,更好的做法是把 LLM 判定当作特征,外接逻辑回归等标准机器学习模型。

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

作者提出 LLM 直接当分类器缺乏校准和可解释性,更好的做法是把 LLM 判定当作特征,外接逻辑回归等标准机器学习模型。

中文正文 · AI 翻译

将大语言模型(LLM)作为分类器,即向上下文应用提示并返回标签,使用起来很糟糕。尤其令人痛苦的是,它们的性能往往相当不错。

但让我们考虑一下我们希望分类器具备的一些特性,以及将LLM作为分类器在这些方面表现如何:

LLM 内置了一些先验信息,这些信息可能与我们的分布不符。例如,LLM 不会知道我们是在测试一个正类稀少的人群,还是在测试一个正类相对普遍的选择人群。我想你可以给它提供这些上下文,但现在你必须为每一个新的人群修改它,而且,正如我们的第一个观点所述,还不清楚这是否会被适当地纳入LLM的判断。

这些失败并不是LLM的错:它并不是作为分类器设计的,实际上也没有合理完成这类任务的机制。但这只是因为我们在思考问题时方法不对……

通过适当的框架来利用LLM的能力,我们可以获得LLM的强大功能,同时享有标准机器学习算法的便利。想了解可能性的话,可以考虑用一个简单的逻辑回归来包装LLM的判决:

\[ p(y = 1 \mid x) = \sigma(\alpha + \beta \cdot LLM(x)) \]

注意,在\(\beta \rightarrow \infty\)的特殊情况下,这基本上就是恢复了我们的LLM分类器!!但那是一个愚蠢的参数选择策略。我们应该采用通常的方法,使用一些训练数据来估计参数。这样就会归结为两种情况,我们只需获得经验估计。

\[ p(y = k \mid LLM(x) = 1) = \frac{\sum_{i} I(y_{i} = k \text{ 和 } LLM(x_{i}) = 1)}{\sum_{i} I(LLM(x_{i}) = 1)} \]

现在让我们重新审视我们的期望:

我们基本上已经恢复了我们模型所希望的所有良好特性!我们还能进一步吗?

假设我们对分类器的性能不满意:我们应该怎么办?在LLM作为分类器的情况下,我们唯一的选择是尝试改动提示。这是一项神秘的工作,互联网上有很多建议,但真正的智慧却很少。祝你好运。

从机器学习的角度来看,让你的模型变得更好是:

我们用一个例子让情况更具体。我们将使用SemEval 2018任务3数据集:https://github.com/Cyvhee/SemEval2018-Task3 2:#fn:2,这是一组由专家标注者标记为讽刺的4618条推文(3834条train / 784条测试)。讽刺是这篇文章的自然契合,这是一个NLP任务,LLM显然有真实信号,我们从LLM中隐含的世俗知识中受益。

我们的提示要求模型做出二元讽刺判断,我们会一次性对所有推文进行批量处理:

仅凭这个提示,我们就得到了以下的表演

这款游戏作为一次性游戏的表现其实相当惊人。你不会指望没有学习就能做到这一点,这正是大型语言模型的好处。当然,整体还是很一般:Brier分数很差,因为我们没有校准(实际上,随便猜测的Brier分数只有0.25)。

我们可以用逻辑回归做得更好,因为它能实现校准(不过注意,这不会影响排序,所以F1是一样的)。

让我们来看看一些额外的大型语言模型特性。首先,让我们快速看看我们的错误分类(无论哪个模型都是一样的)

鉴于此,我们修改一下提示如下

我们还会开始添加一些确定性特征,这些特征我们可以计算:

那么我们看到改进了吗?我们比较了三个嵌套模型:仅判决模型、判决+所有LLM特征、判决+所有特征(LLM+基于规则)。

我们看到每个附加功能层面的明显益处,包括那些位于LLM之外的确定性特征。

系数图显示模型实际依赖的特征,并控制其他所有特征:

图1:逻辑回归系数(± 1 SE),按|系数|排序。

我们的方法与该数据集的已发表文献相比如何?

我们看到初始LLM分类器远远领先竞赛冠军(0.747对0.705)。从特征工程角度看,我们有重叠的CI与竞赛后最先进的技术,仅基于LLM提取特征进行逻辑回归。

让大型语言模型(LLM)能够可靠地作为分类工具是一项艰巨的工作,但潜力巨大。越来越多的研究依赖LLM进行分类:比如《How People Use ChatGPT》:https://minimallysufficient.com/ephemera/how-people-use-chatgpt/,利用LLM对与LLM的对话进行分类,5:#fn:5,或者Huggingface事件中的“slop-vestigation:https://x.com/RyanGreenblatt/status/2092692685224325542?s=20”。我们需要从这些工具中获得高质量的结果。

幸运的是,越来越多的论文正在提出这一观点。

我个人对研究代理分类器很感兴趣。你不是固定的特征集或类陈述,而是赋予LLM自我调查的能力。LLM可以在分类时利用调查过程的特征作为特征:本质上是根据调查的严谨性和全面性来给自己打分。有了可靠的测试集,我们就能对结果做出统计上有效的推断!

这在多模态模型中甚至不使用图片时也能看到:https://arxiv.org/abs/2603.21687。︎ ↩:#fnref:1

Van Hee, C., Lefever, E., 和 Hoste, V.(2018)。SsemiEval-2018 任务3:英语推文中的讽刺检测。载于第12届国际语义评估研讨会论文集(第39–50页)。计算语言学协会。https://aclanthology.org/S18-1005/:https://aclanthology.org/S18-1005/ ↩︎:#fnref:2

Wu 等(2018)。THU/_NGN 于2018年半期评估任务3:通过密集连接LSTM和多任务学习进行推文讽刺检测。2018年学期评估论文集。︎ ↩:#fnref:3

Baziotis 等人(2018)。NTUA-SLP 在 SemEval-2018 任务 3:利用词语和字符级别注意力 RNN 集合追踪讽刺推文。SemEval 2018 会议论文集。︎ ↩:#fnref:4

有反馈吗?我很想听听你的声音——邮箱:#或保持匿名:https://www.admonymous.co/minimallysufficient。

情报判断

Aioga 编辑摘要

文章认为,直接通过提示词让大语言模型返回分类标签,虽然可能取得较好表现,但在校准、可解释性和分布适配方面存在不足。作者建议将模型判定作为特征,再使用逻辑回归等标准机器学习模型完成分类。

背景分析

来源指出,大语言模型包含的先验信息可能不适合目标数据分布,也未必能正确反映阳性类别的实际比例。作者认为,这些问题与模型并非为分类器设计有关,并展示了用训练数据估计逻辑回归参数的思路。

Aioga 观点

Aioga 判断:把大语言模型输出置于可训练的统计框架中,可能比直接把提示词结果当作最终分类更便于校准和解释。但这一判断依赖训练数据及其与目标分布的匹配程度,不能据此保证分类效果。

影响与后续

可能影响:采用该思路的团队需要准备带标签的训练数据,并评估大语言模型判定与目标分布的关系。逻辑回归包装不代表模型先验问题会自动消失,也不足以证明所有分类任务都适合这一方案。 后续观察:应关注作者是否提供训练数据、评估结果及不同数据分布下的比较,并核验逻辑回归包装后在校准性、可解释性和分类表现上的实际变化。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: minimallysufficient.com

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-18T08:08:34.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

作者提出 LLM 直接当分类器缺乏校准和可解释性,更好的做法是把 LLM 判定当作特征,外接逻辑回归等标准机器学习模型。

Hacker News 热门(buzzing.cc 中文翻译)2026-09-18T08:08:34.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。