蚂蚁集团开源两款AI安全模型,SingGuard为大模型与智能体提供安全护栏

蚂蚁集团近日宣布开源两款智能体安全模型,分别是面向智能体行为安全的SingGuard-NSFA,以及面向多模态内容安全的SingGuard。这两款模型主要针对大模型和AI智能体在实际应用中面临的行为失控、权限滥用、提示词攻击和多模态内容绕过等问题,为开发者提供更加完整的底层安全能力。

随着AI智能体开始连接搜索、数据库、文件系统、办公软件和业务接口,模型的安全问题已经不再局限于“回答是否准确”。当智能体拥有执行任务的权限后,它还需要判断当前操作是否合理、是否超出授权范围,以及用户输入中是否隐藏了恶意指令。

image.png

蚂蚁集团此次开源的SingGuard-NSFA和SingGuard,分别从智能体行为控制与多模态内容识别两个方向提供安全支持,帮助企业在模型调用和任务执行过程中增加可配置的安全检测机制。

SingGuard-NSFA是什么?

SingGuard-NSFA是一款面向智能体安全的模型,重点用于检测和控制AI智能体的操作行为。根据目前公布的信息,该模型覆盖7大类、28个中类和185个具体场景,可以对智能体运行过程中的潜在风险进行实时检测。

传统聊天机器人通常只需要生成文字回答,而AI智能体可能需要执行更多动作,例如:

查询企业内部数据库
读取或修改本地文件
调用第三方API
发送邮件和消息
创建订单或提交表单
执行代码或系统命令
调整业务配置
访问用户权限范围内的数据

这些操作一旦缺乏安全控制,就可能产生数据泄露、越权访问、错误执行或业务损失。SingGuard-NSFA的作用,就是在智能体进行任务规划和工具调用时,对相关行为进行识别和判断。

7大类、28个中类和185个场景意味着什么?

SingGuard-NSFA并不是只检测一种简单风险,而是试图覆盖智能体在多个应用环节中可能出现的安全问题。

7大类可以理解为较高层级的风险分类,28个中类则进一步细分具体问题,185个场景则对应实际业务中可能遇到的操作情境。

在智能体应用中,风险往往不是单一指令直接造成的,而是多个步骤连续组合后产生。例如:

第一步,用户让智能体查找一份内部资料。

第二步,智能体读取资料后发现其中包含隐藏指令。

第三步,智能体按照隐藏指令调用外部服务。

第四步,智能体将内部信息发送到不可信的地址。

如果只检查用户最初输入,可能无法识别后续风险。智能体安全模型需要结合任务目标、工具权限、上下文内容和执行动作进行综合判断。

SingGuard-NSFA的场景化覆盖,可以帮助开发者更具体地建立安全检测规则,而不是只依赖一个笼统的“允许”或“禁止”判断。

SingGuard多模态安全护栏是什么?

SingGuard是一款面向多模态内容安全的安全护栏模型,主要用于识别隐藏在文字、图片等不同模态中的复杂攻击。

随着多模态大模型被广泛应用,攻击者不一定会直接在文字中输入恶意指令,也可能将攻击内容放入图片、截图、扫描文件或其他视觉材料中。如果系统只检测文本内容,就有可能遗漏通过图像或混合内容传递的风险信息。

SingGuard可以用于识别以下类型的多模态风险:

图片中的隐藏文字指令
截图中的恶意操作要求
文本与图片组合形成的绕过内容
伪装成普通资料的攻击信息
通过视觉内容诱导模型执行危险操作
多轮对话中逐步形成的攻击意图

多模态安全的难点在于,模型需要同时理解内容本身和内容背后的意图。同一张图片在普通场景中可能只是资料,但当它被放入特定任务流程后,可能成为诱导模型越权操作的载体。

SingGuard支持运行时动态加载安全规则

SingGuard的一项重要能力,是支持在运行时动态加载自然语言安全规则。

传统安全系统通常需要提前编写固定规则,并通过代码或配置文件部署。当业务变化、攻击方式变化或企业政策更新时,安全团队需要重新修改系统并发布新版本。

自然语言安全规则则允许开发者直接用较容易理解的语言描述安全要求。例如:

“禁止将企业内部资料发送到未经授权的外部平台。”

“涉及付款、删除数据和修改权限的操作,必须经过人工确认。”

“用户上传的图片不能诱导模型执行系统命令。”

“禁止读取与当前任务无关的敏感个人信息。”

通过运行时动态加载规则,企业可以根据不同项目、用户角色和业务场景调整安全策略。开发者不必每次都修改底层代码,就可以更新部分安全要求。

动态规则适合哪些场景?

第一,企业内部权限管理。

不同部门对数据和工具的访问权限并不相同。企业可以根据部门、岗位和项目为智能体加载不同安全规则。

第二,金融和支付业务。

涉及转账、支付、退款和账户修改的操作,通常需要更严格的确认流程。企业可以通过自然语言规则要求智能体在执行敏感动作前暂停并请求人工确认。

第三,医疗和健康服务。

医疗数据具有较高敏感性。系统可以根据业务要求限制数据访问范围,并避免智能体对用户给出超出服务范围的判断。

第四,内容平台审核。

平台可以根据不同频道、年龄层和内容类型加载不同审核规则,提高内容安全策略的灵活性。

第五,企业智能办公。

当智能体连接邮件、文档、日历和项目管理系统时,企业可以限制它的发送、删除、共享和修改权限,避免操作范围超出用户授权。

为什么AI智能体需要安全护栏?

大模型本身通常擅长理解语言和生成内容,但它并不会天然知道某项操作是否符合企业政策,也不能自动判断某个工具调用是否超出权限。

当模型连接外部工具后,风险主要来自几个方面。

工具权限过大

如果智能体同时拥有读取、写入、删除和发送权限,单次判断错误可能带来较大影响。

用户意图不清晰

用户可能只说“帮我处理一下文件”,但没有明确是否允许删除、修改或对外分享。智能体需要在不确定时请求确认,而不是自行扩大操作范围。

外部内容包含隐藏指令

网页、邮件、文档和图片中可能包含与当前任务无关的恶意指令,诱导智能体偏离原始目标。

多轮对话逐步绕过限制

攻击者可能通过多次普通提问,逐步引导模型完成单独看似无害、组合起来却存在风险的操作。

模型输出不稳定

即使同一个请求,在不同上下文、不同模型版本或不同工具环境下,也可能产生不同结果。因此,企业需要在模型之外增加独立的安全检测层。

SingGuard系列如何帮助开发者?

对于开发者来说,安全模型可以被放在智能体执行链路中的多个位置。

在用户输入阶段,系统可以检测文本、图片和文件中是否存在明显的攻击内容。

在任务规划阶段,系统可以判断智能体制定的计划是否超出用户目标,是否包含危险操作。

在工具调用阶段,系统可以检查调用对象、参数、权限和数据范围。

在结果输出阶段,系统可以检测是否包含敏感内容、错误信息或不应向用户展示的数据。

在运行过程中,系统还可以根据新加载的安全规则,对智能体行为进行动态约束。

一个相对完整的安全流程可以是:

用户输入内容,安全护栏进行预检查;智能体生成任务计划,行为模型进行判断;智能体准备调用工具,权限策略进行校验;工具返回结果后,系统再次检查数据;最终输出前,进行内容安全和敏感信息检测。

这类多层检测方式,可以减少安全风险集中在单一环节的问题。

开源两款安全模型有什么意义?

首先,开源可以让开发者更容易了解模型能力和使用方式。企业可以结合自己的智能体应用进行测试,观察模型在不同业务场景下的检测表现。

其次,开源有助于推动安全能力进入更多AI应用。很多中小团队在开发智能体时,往往更关注功能上线,而安全系统建设相对滞后。开放模型和相关能力后,开发者可以更方便地将安全检测加入产品架构。

再次,开源可以促进安全评测和场景研究。不同团队可以围绕提示词攻击、权限越界、多模态绕过和工具调用风险进行测试,积累更加丰富的案例。

最后,开源也有助于行业形成更清晰的安全实践。AI安全不只是模型提供方的责任,应用开发者、平台运营方和企业用户都需要参与安全治理。

AI安全模型是否可以完全阻止攻击?

不能。安全模型可以提高风险识别和行为控制能力,但无法保证所有攻击都被识别,也不能替代完善的权限系统和人工审核机制。

企业在使用安全模型时,还需要结合以下措施:

采用最小权限原则
对敏感操作设置二次确认
将读取、写入和删除权限分开管理
对工具调用进行参数校验
记录完整的操作日志
设计异常行为告警
定期进行安全评测
建立人工接管机制
对敏感数据进行脱敏处理

安全护栏应该是AI应用的一层防线,而不是唯一防线。尤其在金融、医疗、政务和企业核心系统中,仍然需要建立多层安全体系。

SingGuard适合哪些应用场景?

企业智能体

企业可以将SingGuard用于内部知识库、办公助手和业务自动化智能体,检测模型是否访问了不应访问的数据,或执行了未授权的操作。

客服与服务机器人

客服机器人可能接收文字、图片、文件和截图。多模态安全护栏可以帮助识别用户输入中的复杂攻击,降低恶意内容影响服务系统的风险。

智能编程助手

编程智能体可能读取项目文件、执行命令或修改代码。通过行为检测和权限约束,可以限制危险命令和无关文件访问。

智能办公平台

当AI连接邮件、日历、文档和审批系统后,安全模型可以帮助判断是否允许发送邮件、共享文件或提交审批。

多模态内容应用

涉及图片理解、文件解析和视觉问答的应用,可以通过SingGuard检测隐藏在图片和文档中的异常指令。

开发者使用SingGuard需要关注什么?

开发者首先需要明确安全模型在系统中的位置。是用于输入检测、工具调用检测,还是作为整个智能体流程的独立安全层,不同部署方式会影响接口设计。

其次,需要根据业务建立安全规则。安全规则不应只写“禁止危险操作”,而应明确哪些操作属于危险、哪些用户拥有权限、何时需要人工确认,以及异常情况下如何处理。

再次,要测试误报和漏报问题。如果规则过于严格,可能阻断正常任务;如果规则过于宽松,又可能无法有效识别风险。因此,企业需要使用真实业务样本进行持续评估。

最后,要记录安全检测结果。日志可以帮助开发者分析哪些请求被拦截、哪些行为被标记为风险,以及系统是否存在重复误判。

结语

蚂蚁集团此次开源SingGuard-NSFA和SingGuard,分别聚焦智能体行为安全与多模态内容安全。SingGuard-NSFA覆盖7大类、28个中类和185个具体场景,可用于智能体实时安全检测;SingGuard则面向文字、图片等多模态内容,支持运行时动态加载自然语言安全规则。

随着AI智能体逐步连接更多工具和业务系统,安全护栏将成为大模型应用的重要基础能力。开发者在使用开源安全模型时,还需要结合权限管理、人工确认、日志记录和数据保护机制,建立适合自身业务的多层安全体系。

相关链接:

蚂蚁集团官方网站: https://www.antgroup.com/

FAQ:SingGuard与SingGuard-NSFA常见问题

问:SingGuard-NSFA是什么?

答:SingGuard-NSFA是蚂蚁集团开源的智能体安全模型,主要用于检测智能体的任务规划、工具调用和操作行为。

问:SingGuard是什么?

答:SingGuard是面向多模态内容安全的护栏模型,可以识别文字、图片等不同模态中的复杂攻击内容。

问:SingGuard-NSFA覆盖多少种安全场景?

答:根据目前公布的信息,SingGuard-NSFA覆盖7大类、28个中类和185个具体场景。

问:SingGuard支持自然语言安全规则吗?

答:支持。SingGuard可以在运行时动态加载自然语言安全规则,方便开发者根据业务变化调整安全策略。

问:这两款模型可以完全保证AI安全吗?

答:不能。安全模型可以提高风险检测能力,但企业仍需要结合权限控制、人工确认、日志审计、数据脱敏和异常告警等措施。

问:SingGuard适合哪些AI应用?

答:它适合企业智能体、客服机器人、智能编程助手、办公自动化、多模态问答和连接外部工具的AI应用。

© 版权声明

相关文章

暂无评论

none
暂无评论...