출처: IT之家 · 원문 보기 ↗
원문 저작권은 출처에 있습니다. 이 사이트는 수집, 번역 또는 형식 정리만 합니다.
사실 흐름 IT之家 8 月 5 日消息,Mistral AI 昨日(8 月 4 日)发布公告,宣布推出 Shieldstral 内容审核 AI 模型,总参数量为 3B(30 亿),采用开放权重,依据 Apache 2.0 许可证发布。 模型已上线 Hugging Face 平台,支持 12 种语言,可在单张 16GB GPU 上运行。Mistral 表示该模型在内容安全方面,性能媲美 7 倍规模的开放模型, 并且在多模态内容审核领域实现 SOTA
해설과 영향 Shieldstral 的核心创新在于其“策略即输入”的机制。传统的审核模型通常将特定的伤害类别(如暴力、仇恨言论)直接编码在模型权重里,一旦应用场景或审核标准发生变化,开发者往往需要重新训练或微调模型,过程繁琐且成本高昂。Shieldstral 则另辟蹊径,它将审核任务转化为一个二元问答。使用者只需在输入时提供一个“是或否”的问题,并附上对评估场景和严格程度的描述,模型便会从输出中生成一个经过校准的安全分数,从而判断内容是否违规 IT之家 。这种设计让同一套模型权重能够灵活适配几乎任何内容安全政策,无需重新训练。
Shieldstral 模型技术架构与输入输出示例
在技术规格上,Shieldstral 总参数量为 3B(30 亿),采用开放权重,并依据宽松的 Apache 2.0 许可证发布,目前已上架 Hugging Face 平台。它对硬件要求非常友好,仅需单张 16GB 显存的 GPU 即可运行,这大大降低了中小企业和独立开发者的部署门槛。Mistral 官方宣称,该模型在内容安全任务上的表现可媲美规模是其 7 倍的开放模型,并在多模态内容审核领域达到了当前最先进水平(SOTA)IT之家 。模型支持包括中文在内的 12 种语言,能够覆盖提示词分类、回答审核和毒性检测等多种任务。
Shieldstral 在 Hugging Face 平台上的模型页面
这项发布恰逢业界对 AI 生成内容治理日益关注的时期。就在 Shieldstral 亮相后不久,小红书发布了《AI 治理规则公告》,鼓励创作者主动披露 AI 生成内容,并反对 AI 洗稿、合成他人声音等行为 IT之家 。高效、可定制的开源审核工具,对于平台方在遵循日益严格的合规要求的同时,处理海量多模态内容至关重要。Shieldstral 的低成本和灵活性,为构建更负责任的 AI 应用生态提供了一种强有力的基础设施选择。
Shieldstral 模型性能对比与多语言支持示意图
출처 원문 IT之家 8 月 5 日消息,Mistral AI 昨日(8 月 4 日)发布公告,宣布推出 Shieldstral 内容审核 AI 模型,总参数量为 3B(30 亿),采用开放权重,依据 Apache 2.0 许可证发布。 模型已上线 Hugging Face 平台,支持 12 种语言,可在单张 16GB GPU 上运行。Mistral 表示该模型在内容安全方面,性能媲美 7 倍规模的开放模型, 并且在多模态内容审核领域实现 SOTA。 IT之家注:SOTA 全称为 state-of-the-art,是指在特定人工智能任务或基准测试中表现最优秀、水平最先进的模型或算法集合,它会随着技术迭代和新研究的发布而不断变化。 Mistral 指出,多数防护模型会把伤害类别体系固化在模型权重中。产品更换使用场景后,开发者通常需要重新训练模型。 Shieldstral 则把审核政策放入输入内容:操作者可以写入一个“是或否”问题,再提供评估场景和严格程度说明,模型随后从单个输出词元中生成经过校准的安全分数。 模型把每项审核任务转化为二元问答,输入包含 3 个带标签字段: :说明评估场景和严格程度。 :提出单个“是或否”问题,例如“这段内容是否宣传身体暴力?” :提供待审核内容,可以是提示词、回答、提示词与回答组合,也可以是附带可选文本的图像。 推理时,模型只读取“是”和“否”两个词元的逻辑值,再通过 softmax 归一化为连续分数,并以 0.5 为阈值输出二元判断。该机制可覆盖提示词分类、回答审核、拒答检测和毒性检测。