Aioga
AI资讯 / 模型更新
返回 AI资讯

Mistral 开源 3B 安全模型 Shieldstral,以更小体积匹敌七倍规模模型

The Decoder:AI News(RSS)Aioga 编辑团队2026-08-05T16:35:07.000Z热度 60

Mistral 发布开源 3B 参数安全模型 Shieldstral,通过自然语言"是/否"问题而非固定类别来检查 AI 输入输出的安全违规。该模型在部分基准测试中匹敌七倍于其...

模型更新The Decoder:AI News(RSS)

今日 AI 情报摘要

Mistral 发布开源 3B 参数安全模型 Shieldstral,通过自然语言"是/否"问题而非固定类别来检查 AI 输入输出的安全违规。

该模型在部分基准测试中匹敌七倍于其规模的模型,并支持运行者在运行时自行设定标准,无需依赖第三方分类体系,且可在本地运行。

中文正文 · AI 翻译

一篇新论文提出,用是或否的问题取代固定的安全类别,操作人员可以在运行时自行定义,而无需重新训练分类器。

Image description

据论文介绍,法国人工智能公司Mistral推出的拥有30亿参数的模型Shieldstral,在标准文本安全基准测试中表现可与三倍其规模的模型相媲美:https://arxiv.org/abs/2607.25857。Mistral表示,该模型在文本和图像联合分类上也创造了新的高分记录。

许多护栏模型使用固定的分类法对内容进行排序。包括Mistral联合创始人Guillaume Lample在内的论文作者指出了这种方法的两个问题:公共安全数据集对风险的分组相差过大,无法支持统一的分类法;同样的规则并不适用于所有用例。适用于网络安全工具的内容,在心理健康平台上可能是有害的。

Diagram of the Shieldstral architecture showing a fixed system prompt and customizable Instruct, Query, and Document fields feeding into the model, which outputs logits for the yes and no tokens.

操作人员通过类似“此内容是否宣传暴力?”的自然语言问题告诉Shieldstral需要检查什么。模型仅回答“是”或“否”,系统再根据每个回答的概率计算出一个介于零到一之间的安全评分。

研究人员将约5410万个涵盖安全、有害内容和操纵尝试的示例整合成统一格式。他们对针对性操纵应用严格标准,对一般安全数据应用中等标准,对响应质量应用宽松标准。

Two training data examples showing a text-only sample with a prompt and response about physical violence on the left, and a multimodal sample with an image and question about explicit content on the right. Both are labeled no.

为了让Shieldstral学习更细微的区分,团队使用另一种语言模型将安全文本改写为不安全变体。每个示例还包含一个类似但不同的类别,必须被拒绝,这训练模型区分紧密相关的规则,而不仅仅做出广泛的安全或不安全判断。

作者将适应性测试类别与训练集分开创建,使用不同的名称和详细级别。他们表示,没有一个细分测试类别与训练类别完全匹配,尽管12个较广类别中的10个大致对应一个训练类别。

在综合文本基准测试中,Shieldstral 的 F1 分数为 84.9%。F1 将精确率和召回率合并为一个指标,100%表示满分。该结果与 OpenAI 的 GPT-OSS-Safeguard-20B 并列,后者的规模约大七倍,并且超过了 Qwen3Guard-8B 的 84.0%、Nemotron-3.5-Safety-4B 的 83.3% 以及 LlamaGuard-4-12B 的 69.1%。Ad DEC_D_Incontent-2

在图像及图文组合测试中,Shieldstral 得分为 83.8%,领先于 OmniGuard-7B 的 77.6% 和 LlavaGuard-7B 的 71.6%。Ad

Bar chart comparing average F1 scores for ten guardrail models. Shieldstral-3B and GPT-OSS-Safeguard-20B lead at 84.9 percent each, while ShieldGemma-9B trails at 54.7 percent.

GPT-OSS-Safeguard-20B 在适应性基准测试中以 94.1% 领先,而 Shieldstral 为 91.3%。此测试使用与训练类别不同或完全新的规则。作者仍认为 Shieldstral 比 GPT-OSS-Safeguard-20B(https://the-decoder.com/openai-releases-gpt-oss-safeguard-open-source-models-for-flexible-ai-safety/) 和 Nemotron-3.5-Safety 更实用,因为后两者会生成较长的中间推理序列,从而增加计算成本,而 Shieldstral 只返回一个词。

Three groups of bars comparing precision, recall, and F1 on the adaptability benchmark. GPT-OSS-Safeguard-20B leads in F1 at 94.1 percent, followed by Nemotron-3.5-Safety-4B at 91.8 percent and Shieldstral-3B at 91.3 percent.

Shieldstral 基于 Mistral 的 Ministral-3B(https://the-decoder.com/paris-based-mistral-releases-large-3-a-major-new-open-source-ai-model/) 和 Pixtral 视觉编码器(https://the-decoder.com/french-ai-company-mistral-unveils-pixtral-12b-its-first-multimodal-model/)。在一个具有细粒度类别的验证测试中,合成类别数据将 F1 分数提高了 23.3 个百分点,研究人员表示这是模型适应新规则能力的主要驱动因素。

Shieldstral 可作为开放权重模型在 Apache 2.0 许可下获取:https://huggingface.co/mistralai/Shieldstral-1.0-3B。

安全分类器位于主语言模型的两侧,分别在处理前筛查提示词,在到达用户前筛查响应。操作人员可以在不重新训练主模型的情况下更新这些规则。但由于每个请求都经过分类器,其大小、速度和成本会迅速累积。

Anthropic 的 Claude Fable 5:https://the-decoder.com/claude-fable-5-the-first-mythos-model-is-powerful-expensive-and-heavily-filtered/ 展示了调校不佳的过滤器如何影响实际使用。Artificial Analysis 发现该系统会自动将 8% 到 9% 的任务路由到性能较弱的模型。一位医学物理学家称 Fable 5 无法使用,因为他的工作经常包含“核”字。其他用户报告系统将 MRI 分析标记为生物恐怖活动。

Anthropic 在发现安全问题后收紧了过滤器,并表示从那时起已经更频繁地阻止无害的编码任务:https://the-decoder.com/anthropics-fable-5-is-back-worldwide-after-a-two-week-government-ban-over-a-jailbreak/。Shieldstral 让操作员在这种权衡中拥有更多控制权。他们可以在运行时编写筛选标准,并针对特定应用调整过滤器,而不是采用别人的分类。

这些分类器在整个行业中已经发挥着越来越重要的作用。OpenAI 在 ChatGPT 中使用它们进行自动年龄检测:https://the-decoder.com/openai-rolls-out-age-prediction-to-apply-teen-safeguards-in-chatgpt/,并将情绪请求通过安全过滤器:https://the-decoder.com/openai-adds-parental-controls-to-chatgpt-for-teens/ 路由到更严格的模型。Claude Code:https://the-decoder.com/claude-codes-new-auto-mode-tries-to-balance-safety-and-speed/ 使用分类器来阻止外部脚本、生产部署和强制推送。Anthropic 对 Fable 5 的评审还要求公司存储输入和输出:https://the-decoder.com/claude-fable-5-anthropic-admits-wrong-tradeoff-after-invisibly-throttling-rival-ai-researchers/ 最长 30 天,或在违反规则后最长两年。

保持对 AI 的了解。清晰、实用、无废话。

关注 The Decoder 获取 AI 新闻、背景故事和专家分析。

解码器:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Mistral 发布开源 3B 参数安全模型 Shieldstral,采用运行时可定义的自然语言“是/否”问题检查输入输出,并以回答概率计算安全分数。论文称其在综合文本基准上达到 84.9% F1,与约七倍规模的 GPT-OSS-Safeguard-20B 持平。

背景分析

现有护栏模型通常依赖固定安全分类体系,但论文作者认为不同数据集和应用场景对风险划分并不一致。Shieldstral 将检查标准改写为运行者可定义的问题,并通过约 5410 万个安全、有害内容和操纵尝试样本训练模型。

Aioga 观点

Aioga 判断,Shieldstral 的核心价值在于把安全审核标准从固定分类表转向可调整的问题配置;这可能降低特定场景适配对重新训练的依赖。但当前材料只说明其在部分基准上的表现,不能据此推断真实部署中的整体安全效果。

影响与后续

若论文结果能够在更多场景中复现,较小模型结合运行时规则的方式,可能为本地部署和定制化审核提供新的技术路径。值得关注的是,模型对自然语言标准的理解是否稳定,以及不同标准设置会否带来审核结果差异。 后续应核对论文完整实验设置、测试集与训练集是否存在交叉影响,并观察 Shieldstral 在文本与图像联合分类、不同语言及具体业务规则下的表现。部署方还需独立测试误报、漏报和规则变更后的稳定性。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-05T16:35:07.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Mistral 发布开源 3B 参数安全模型 Shieldstral,通过自然语言"是/否"问题而非固定类别来检查 AI 输入输出的安全违规。该模型在部分基准测试中匹敌七倍于其...

The Decoder:AI News(RSS)2026-08-05T16:35:07.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。