Mistral 开源 3B 多模态安全分类器 Shieldstral,支持推理时自定义政策无需重训
Solutions Introducing Shieldstral. August 4, 2026 By Mistral
Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,以 Apache 2.0 协议开放下载。它把内容审核建模为政策自适应问答任务,推理时用自然语言问题传入政策即可返回校准的安全分数,无需重训练,统一覆盖文本、图像及 prompt-response 对的审核、拒答检测和毒性检测。
原文给出了把内容审核改为推理时自适应问答的方法、数据构建思路和基准表现,适合想自建安全审核方案的开发者参考。
Thinking
Summary
Shieldstral 推出了一款 3B 开放权重多模态安全分类器,通过将内容审核构建为策略自适应问答任务,其表现超越了规模最高达其 7 倍的模型。与传统护栏模型不同,它在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。该模型以 Apache 2.0 许可发布,在多种基准测试中提供校准的安全评分,同时可在单块 16GB NVIDIA GPU 上高效运行。
一款 3B 开放权重、策略自适应的多模态安全分类器,在文本安全方面可与规模最高达其 7 倍的模型匹敌,并在多模态审核方面树立了新的最先进水平。
“这段内容是否在煽动针对受保护群体的暴力?这张图片是否适合向未成年人展示?助手是否拒绝了该请求?”
每一个发布模型的产品都需要回答这类问题——但正确答案取决于产品、受众和具体场景。同样的内容对网络安全研究工具来说可能没问题,但在心理健康平台上却可能有害。大多数护栏模型将固定的危害类别分类体系固化在权重中,因此要将其重新定位到新的部署场景就意味着重新训练。而且,由于安全定义因应用和领域而异,从一开始就不存在一套单一的“正确”类别可供建模。
Shieldstral 采取了不同的方法:你在推理时以自然语言问题形式编写策略,模型返回校准后的安全评分。无需重新训练,文本和图像共用一个接口,一个 token 即可给出判定。请参阅我们的技术报告。
作为与 NVIDIA 及其他组织共同发起的开放安全 AI 联盟的创始成员,今天我们以 Apache 2.0 许可开放发布 Shieldstral 的权重,可在此处下载。
将审核视为一个问题
Shieldstral 将内容审核构建为二元问答任务。每个请求包含三个部分:
<Instruct>—— 评估上下文、严格程度,以及(可选)对何种内容算作不安全的定义。<Query>—— 一个单一的 yes/no 问题,例如 “这段内容是否煽动身体暴力?”<Document>—— 待判断的内容:一个提示、一个回复、一个提示–回复对,或一张带可选文本的图像。
在推理时,模型仅读取 yes 和 no 的 logits,并通过 softmax 归一化为连续的安全评分。这一简单公式发挥了很大作用:它将提示分类、回复审核、拒绝检测和毒性检测统一为一个问题;它让策略完全存在于提示中,因此一个检查点即可在部署时适应新的策略。
亮点
性能强劲 —— 在文本安全、拒绝检测、策略适应性和多模态基准测试中,与规模最高达其 7 倍的开放护栏模型相当或更优。
自适应且灵活 —— 单一自然语言接口覆盖文本、图像和文本+图像内容,适用于提示、回复和提示–回复对。策略以自由形式查询提供,并可在推理时重新定位,无需重新训练。
小巧,基于异构来源训练 —— 一个 3B 模型,可在单张 16GB GPU 上运行,基于真实和合成数据训练,涵盖多样的标签格式和分类体系,并整合到一个框架中。
连续安全评分 —— 通过单次前向传播返回经过校准的
yes/no概率,因此你可以按置信度设置阈值或排序,而不必依赖离散标签。开放 —— Apache 2.0 权重。
基准测试
我们在四个维度上评估 Shieldstral,与规模最高达其 7 倍的开放防护模型进行对比。所有评估样本均从训练中留出。
我们如何构建它
核心思路是:只要数据合适,小模型可以击败大得多的模型。要让数据合适,需要解决四个问题:
统一异构数据。 公共安全数据集在分类体系、标签和标注惯例上各不相同——从二元的 safe/unsafe 标记到细粒度的多标签分类体系。我们通过每个数据集专属的处理器,将每个数据集转换为相同的指令–查询–文档格式,并改变指令、查询以及提示–回复分隔符的措辞,使模型能够泛化到不同表述,而不是过拟合于某一种风格。我们还按来源校准严格程度——对对抗性越狱严格,对回复质量数据宽松——使模型学习到经过校准的决策边界。这让我们能够整合原本互不兼容的来源。
教判别,而非记忆。 如果只在固定的一组策略标签上训练,模型只会学会对这些预定义策略进行分类,而不会推理给定策略的精确边界。这会阻碍其泛化到新策略。相反,我们构建一组刻意相似、容易混淆的策略,并让 LLM 将安全文本改写为对比样本对:每个改写都被设计为违反其中一个策略,但不违反其同类策略。这训练模型区分一段内容具体违反了哪个策略,这种能力在推理时可迁移到未见过的、用户自定义的策略。
将安全建立在图像之上。 不安全图像无法像文本那样由 LLM 合成,因此视觉安全数据稀缺。我们用通用图像数据集作为高质量负样本,补充有限的审核数据集,变异查询以扩充数据集,并通过视觉–语言重排序器过滤每个图像–查询对,以减少错误标注数据和幻觉。
合并互补的检查点。 我们使用 LoRA 进行微调,并通过 SLERP 合并——一个在公共数据上校准的检查点、一个从生成数据中增加细粒度策略判别能力的检查点,以及基础 instruct 模型。该合并将常见的策略校准和策略适应性恢复到一个模型中,并且基础模型的指令遵循能力可迁移到审核任务。
Forge。我们在 Forge 上端到端构建了 Shieldstral,这是我们用于训练、对齐和评估自定义模型的平台。Forge 在最先进的分布式训练之上管理基础设施、数据和模型分片、指标和日志记录,因此团队可以专注于数据——而数据正是决定安全模型质量的关键。
下一步
Shieldstral 是迈向能够适应上下文的审核方式的一步,而不是让每个产品都套用一套固定不变的分类体系。我们将继续推进多语言覆盖、更长文档的稳健性以及更广泛的多模态安全——我们也期待看到社区在此基础上构建出什么。
顺便说一句,我们正在招聘!如果你想帮助让 AI 变得更好,请查看我们的招聘页面。
来源:Mistral AI:News(网页) · mistral.ai