Mistral推出Shieldstral模型,提供轻量级AI内容审核方案
法国初创公司Mistral AI推出了名为Shieldstral的轻量级多模态安全模型,该模型能够为AI生成的内容提供政策感知的安全评估。开发者可以在运行时用自然语言编写策略,并获得明确的安全评分。Shieldstral无需专门重新训练即可存储文本和图像中的积极能力,并能通过单一令牌给出“是”或“否”的判断结果。据称,在多样化的安全基准测试中,该模型的表现优于其七倍大小的其他大型语言模型,平均综合安全评分为84.9%。Shieldstral能够在不混淆的情况下应用两种紧密相关的政策,例如区分恶意软件指令和网络安全讨论,并且能够处理对比对等的内容。此外,它还支持跨文本、图像以及图文组合内容的安全评估,适用于客户服务对话中的快速响应生成。
