Mistral 推出 Shieldstral,一款带有运行时策略控制的 3B 守护模型

该 Apache 2.0 版本根据通俗易懂的政策对文本和图像进行评估,为开发者提供了一个精简的、可自行运行的内容审核层。

By · Published · Updated

Primary source: Mistral Blog

Why it matters

Mistral is extending its open-model strategy into the safety layer, where policy control, inference cost and data privacy increasingly shape which AI stacks enterprises adopt.

Mistral ships Shieldstral, a 3B guard model with runtime policy controls

Mistral AI 联合创始人 Arthur Mensch、Guillaume Lample 和 Timothee Lacroix 于 8 月 4 日发布了 Shieldstral,为开发者提供了一个 30 亿参数的模型,可在推理时根据用普通英文书写的审核政策对文本和图像进行评估。

这三位创始人围绕对封闭式 AI 开发的直接挑战建立了 Mistral。根据 Mistral 的创始人简介,Mensch 来自 Google DeepMind,而 Lample 和 Lacroix 曾在 Meta 工作。自 2023 年 4 月在巴黎成立该实验室以来,他们一直主张模型权重、部署选择和技术控制应由客户掌控。Shieldstral 将这一立场扩展到安全基础设施:部署者定义政策、运行分类器并选择在哪里划定执行界限。

Apache 2.0 权重 可通过 Hugging Face 获取。

这一足迹很重要,因为审核很少是一次性检查。AI 产品可能在同一次交互中检查用户提示、检索到的文档、上传的图像和生成的响应。一个较小的分类器可以在路径的多个点上处理审核,而无需承担其所监督的更大型模型的推理成本。

The policy lives in the prompt

大多数守卫模型围绕预定义的类别列表进行训练,例如暴力、仇恨言论或自我伤害。更改分类法可能需要重新训练、微调或将新规则强行塞入模型开发者选择的类别中。

Shieldstral 将审核转变为二元问答任务。每个请求包含建立上下文和严格程度的指令、描述政策的是/否问题,以及被评估的文档。文档可以是提示、响应、提示-响应交换、图像或伴随文本的图像。

例如,网络安全工具可以询问某个响应是否为利用特定漏洞提供了操作指令,同时允许防御性分析。心理健康服务可以对涉及自我伤害的内容应用更严格的规则。这两种应用都可以使用相同的检查点,通过请求表达政策差异。

Shieldstral 读取单词 yesno 的 logits,将它们归一化为连续分数,并通过单个生成的 token 返回其裁定。操作员随后可以选择阈值、按置信度对案例排序或将边界性材料路由到另一审查层。

Mistral's data bet

技术报告 于 7 月 28 日发布,比产品公告早了六天。报告在 11 位作者中列出了 Mistral 联合创始人兼首席科学官 Guillaume Lample,以及 Antonia Calvi、Avinash Sooriyarachchi、Giada Pistilli、Maarten Buyl、Maximilian Augustin、Maximilian Muller、Pierre Stock、Tom Bewley、Wassim Bouaziz 和 Yimu Pan。

他们的核心赌注是数据集构建可以让一个小型安全模型与更大规模的检查点竞争。研究者从开源文本、合成对比文本和多模态数据中汇集了大约 5,410 万个训练样本。

这些来源带来了不兼容的标签和分类法。Mistral 将它们转换为共享的指令-查询-文档格式,改变措辞和对话定界符,并根据来源调整严格程度。对抗性越狱示例受到比旨在衡量一般响应质量的数据集更严格的处理。

研究者还生成了密切相关的政策对。LLM 将安全文本改写为新版本,使其违反一项政策同时避免触及相邻政策。这种训练方法旨在教会分类器区分精确边界,例如讨论武器与促成暴力之间的差别,而不是记忆固定的类别名称。

Shieldstral 基于 Mistral 的 Ministral-3B 架构,并使用 Pixtral 视觉编码器进行多模态评估。研究者使用 LoRA 微调并通过 SLERP 合并检查点,结合在公共数据、生成的政策数据和基础指令模型上训练的模型。Mistral 表示该工作在其用于训练、对齐和评估定制模型的平台 Forge 上完成。

Forge 是 Mistral 创始人战略的重要组成部分。Mistral 正在向企业出售完整的模型构建栈,同时继续发布权重以展示该栈的产能。Shieldstral 既作为可下载的护栏,也作为证据,证明经过精心构造的数据可以在不具备前沿规模参数量的情况下生成有用的专用模型。

The benchmarks remain a starting point

Mistral 报告在其文本安全评估中平均 F1 得分为 84.9%,在三个多模态基准中的平均 F1 为 83.8%,在其细粒度政策适应性评估中 F1 为 91.3%。公司表示 Shieldstral 与或优于参数数量高达其七倍的开源守卫模型。

这些是 Mistral 撰写的结果。比较跨越了具有不同样本量、语言和有害内容定义的公开基准。技术报告还描述了在一些低资源语言和对抗性评估上表现较弱的情况。

Mistral 的发布材料在生产问题上留有空白。所提供的研究未披露 Shieldstral 的客户、用户、收入、定价或独立基准结果。这些缺口将是关键,因为审核失败具有不对称成本。未检测到的有害项和被错误阻止的合法项产生不同的风险,而正确的阈值随产品而异。

一个邻近的竞争对手说明了设计权衡。NVIDIA 的 Nemotron 3.5 Content Safety 是一个 40 亿参数的多模态分类器,支持自定义政策、可选的推理轨迹和配套的安全数据集。Shieldstral 提供更小的参数量和一个单 token 分数,更偏向于紧凑的决策层而非可审计的书面解释。

Open weights become part of the safety pitch

Mistral 于 8 月 4 日发布 Shieldstral,距 NVIDIA 于 7 月 27 日推出 Open Secure AI Alliance 相隔八天。Mistral 是其首批合作伙伴之一,成员还包括 AI 实验室、云提供商、安全公司和开源组织。该组织主张防御者需要能够在自身基础设施内检查、修改并运行的安全与保障工具。

这种表述契合 Mensch、Lample 和 Lacroix 三年来构建的战略。RuntimeWire 在 7 月报道 Mistral 将 Leanstral 1.5 开放用于机器可检验的数学证明。5 月,Mensch 告诉法国立法者欧洲有两年时间来建立对其 AI 堆栈的控制。Shieldstral 将相同的论点应用到执行层:开发者应该能够检视并在本地运行决定其产品允许内容的系统。

此次具体发布是一组可下载的权重和本地部署说明。它使工程团队能够直接控制政策措辞、阈值和数据处理,同时也使他们负责将这些选择针对其自身用户、语言和失败成本进行测试。Shieldstral 为他们提供了一个紧凑的工具。其价值将取决于他们撰写的政策以及围绕其分数建立的审查系统。

Reader comments

Conversation for this story loads after sign-in.