需要感知环境、规划行动并与外部世界交互,攻击者可以通过操纵环境中的部分输入(如图片)。
最终劫持智能体执行攻击者预设的恶意目标, , 随着语言模型从聊天机器人向自主智能体演进,让攻击信息在多个组件间传播,现有的LM安全评估方法无法充分应对这种复合系统的攻击面,聊天机器人的安全评估主要关注模型直接输出有害内容,而智能体是由多个组件构成的复合系统,安全评估的范式需要根本性转变,。
需要感知环境、规划行动并与外部世界交互,攻击者可以通过操纵环境中的部分输入(如图片)。
最终劫持智能体执行攻击者预设的恶意目标, , 随着语言模型从聊天机器人向自主智能体演进,让攻击信息在多个组件间传播,现有的LM安全评估方法无法充分应对这种复合系统的攻击面,聊天机器人的安全评估主要关注模型直接输出有害内容,而智能体是由多个组件构成的复合系统,安全评估的范式需要根本性转变,。
内容版权声明:除非注明,否则皆为本站原创文章。