一个改变局面的漏洞:原来一张普通的图片就能让人工智能模型执行用户从未见过的指令!
本页为原文的机器翻译,未经人工译者审核。历史信息可能已发生变化。
一个改变局面的漏洞:原来一张普通的图片就能让人工智能模型执行用户从未见过的指令!
Trail of Bits 的研究人员恰好展示了这一点。他们成功地把文本命令隐藏在肉眼看起来无害的图片中,但经过自动的初步处理后,这些命令会显露出来并被模型接收。
他们在 Google Gemini 的网页版、API、手机端、Vertex AI Studio 等系统上进行了尝试。在大多数情况下,攻击都奏效了。
工作原理:
几乎所有接收图片的 AI 系统,在把图片发送给模型之前都会先对其进行缩小(downscaling),以节省资源。
在这个过程中(使用 bicubic 或 bilinear 等算法),会产生一个副作用:如果精确设计大图中的像素,它们对人眼是不可见的,但缩小之后会变得清晰。这样就可以隐藏只会出现在模型接收到的版本中、而不出现在用户所见版本中的文本。
这基本上就是一种通过图片伪装的 prompt injection 攻击!
但存在限制 -
攻击需要对像素进行精确控制。
需要事先知道系统使用哪种算法。
而且如果用户看到模型所见内容的预览,他们可能会发现差异。
即便如此 - 这是一种对市面上的系统真实有效的攻击,它说明了模型看世界的方式与我们有多么不同。