Aioga
AI资讯 / AI资讯
返回 AI资讯

Introducing Shieldstral. August 4, 2026 By Mistral

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-08-04T20:41:07.887Z热度 47

Shieldstral introduces a 3B open-weights multimodal safety classifier that outperforms m...

模型更新Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Shieldstral introduces a 3B open-weights multimodal safety classifier that outperforms models up to

7x its size.

中文正文 · AI 翻译

构建、测试并运行 AI 代理和应用程序。

训练、校准并评估自定义 AI 模型。

在终端、IDE 和后台编写代理代码。

用于训练和推理的前沿规模基础设施。

2a1ffaf3-f171-460b-be1b-fc734aa776aa
Introducing Shieldstral. August 4, 2026 By Mistral

你的提示和技能需要一个记录系统。

Shieldstral 推出了一个 30 亿参数开源权重多模态安全分类器,通过将内容审核框架化为政策自适应问答任务,其性能超过大约 7 倍规模的模型。与传统的护栏模型不同,它在推理时接受自然语言政策,无需重新训练即可统一文本和图像的安全评估。此模型在 Apache 2.0 许可证下发布,在运行于单个 16GB NVIDIA GPU 时,可在各种基准上提供校准的安全评分并高效运行。

一款 30 亿参数、政策自适应的开源权重多模态安全分类器,在文本安全方面与大约 7 倍自身规模的模型表现相当,并在多模态审核上创下新的技术标准。

“该内容是否鼓励对受保护群体的暴力?该图像是否适合未成年人观看?助手是否拒绝了请求?”

每款发布模型的产品都需要回答类似问题——但正确答案取决于产品、受众和具体时刻。同一内容在网络安全研究工具上可能无害,而在心理健康平台上可能有害。大多数护栏模型在权重中内置了固定的危害类别,因此将它们重新定位到新部署环境意味着必须重新训练。而且由于安全定义在应用和领域中有所不同,根本不存在唯一“正确”的类别集合用于建模。

Shieldstral 采用了不同的方法:你可以在推理时将政策写成自然语言问题,模型返回校准后的安全评分。无需重新训练,文本和图像共用一个接口,单个 token 即可得出裁定。请参阅我们的技术报告:https://arxiv.org/abs/2607.25857。

作为 Open Secure AI Alliance 的创始成员:https://blogs.nvidia.com/blog/open-secure-ai-alliance/,与 NVIDIA 及其他组织合作,今天我们以 Apache 2.0 许可证开放发布 Shieldstral 权重,可在此下载:https://huggingface.co/mistralai/Shieldstral-1.0-3B。

Shieldstral 将内容审核框架设定为一个二元问答任务。每个请求包含三部分:

— 评估上下文、严格程度,以及(可选的)不安全内容定义。

— 一个是/否问题,例如:“此内容是否促进身体暴力?”

— 待判断内容:一个提示、一个回复、一个提示—回复对,或带可选文本的图像。

在推理时,模型只读取是与否的对数几率,并将其通过 softmax 转换为连续的安全评分。这个简单的公式做了很多工作:它将提示分类、回复审核、拒绝检测和有害内容检测统一为一个问题;它使策略完全存在于提示中,因此一个检查点在部署时即可适应新的策略。

强大性能 — 在文本安全、拒绝检测、策略适应性和多模态基准测试中,性能匹配或超过其 7 倍规模的开源守护模型。

自适应且灵活 — 单一自然语言接口涵盖提示、回复以及提示—回复对的文本、图像和文本+图像内容。策略以自由形式查询提供,并在推理时重新定位,无需重新训练。

小型,异质数据训练 — 一个 3B 模型,可在单个 16GB GPU 上运行,训练数据包含真实和合成数据,且标签格式与分类系统多样化,并整合在一个框架中。

连续安全评分 — 通过单次前向传播返回校准后的是/否概率,因此您可以根据信心进行阈值或排序,而不是依赖离散标签。

我们在四个维度上对 Shieldstral 进行了评估,其规模最高达开源守护模型的 7 倍。所有评估样本均未用于训练。

核心思想是,如果数据正确,小模型可以打败大得多的模型。把数据做对意味着解决四个问题:

统一异构数据。公共安全数据集在分类、标签和标注规范上存在差异——从二元的安全/不安全标记到细粒度的多标签分类。我们使用每个数据集的处理器将每个数据集转换为相同的指令-查询-文档格式,并且我们会变化指令、查询以及提示-响应分隔符的措辞,使模型能够在不同措辞之间泛化,而不会过拟合于某一种风格。我们还根据来源调整严格性——针对对抗性越狱严格,对响应质量数据宽松——使模型学习校准的决策边界。这使得我们能够整合原本不兼容的数据源。

教会区分,而不是记忆。如果仅训练于固定的政策标签集合,模型只会学会对这些预定义政策进行分类,而无法推理出某一政策的精确界限。这会阻碍对新政策的泛化。相反,我们构建成对相似、容易混淆的政策集,并要求大型语言模型将安全文本重写为对比对:每个重写都旨在违反一个政策而不违反其类似政策。这训练模型识别内容违反的是具体哪一条政策,这一能力可以在推理时迁移到未见过的、用户定义的政策上。

以图像为基础进行安全控制。与文本不同,不安全图像无法由大型语言模型生成,因此视觉安全数据稀缺。我们利用通用图像数据集作为高质量的负样本,补充有限的审核数据集,对查询进行变异以扩充数据集,并通过视觉-语言重排序器过滤每个图像-查询对,以减少错误标注数据和幻觉。

组合互补的检查点。我们使用LoRA进行微调,并通过SLERP合并——一个在公开数据上校准的检查点、一个从生成数据中增加细粒度政策区分的检查点,以及基础指令模型。该合并在单一模型中恢复了常见的政策校准和政策适应性,同时基础模型的指令执行能力可以迁移到审核任务上。

Forge。我们在 Forge 上端到端构建了 Shieldstral:https://mistral.ai/products/forge/,这是我们用于训练、校准和评估自定义模型的平台。Forge 管理基础设施、数据和模型分片、指标和日志记录,并基于最先进的分布式训练技术,因此团队可以专注于数据,而数据决定了安全模型的质量。

Shieldstral 是向适应上下文的内容审核迈出的一步,而不是将每个产品强行套入一个固定的分类体系。我们正在继续推进多语言覆盖、更长文档的稳健性以及更广泛的多模态安全——我们也非常期待看到社区在其基础上构建的成果。

顺便说一下,我们正在招聘!如果你想帮助改善 AI,请查看我们的招聘页面:https://mistral.ai/careers。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Mistral 推出 Shieldstral,一款 3B 参数的开源权重多模态内容审核模型。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: mistral.ai

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-04T20:41:07.887Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Shieldstral introduces a 3B open-weights multimodal safety classifier that outperforms m...

Hacker News 热门(buzzing.cc 中文翻译)2026-08-04T20:41:07.887Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。