# 一个改变局面的漏洞:原来一张普通的图片就能让人工智能模型执行用户从未见过的指令!

本页为原文的机器翻译，未经人工译者审核。历史信息可能已发生变化。

一个改变局面的漏洞:原来一张普通的图片就能让人工智能模型执行用户从未见过的指令!

Trail of Bits 的研究人员恰好展示了这一点。他们成功地把文本命令隐藏在肉眼看起来无害的图片中,但经过自动的初步处理后,这些命令会显露出来并被模型接收。 

他们在 Google Gemini 的网页版、API、手机端、Vertex AI Studio 等系统上进行了尝试。在大多数情况下,攻击都奏效了。
  
工作原理:

几乎所有接收图片的 AI 系统,在把图片发送给模型之前都会先对其进行缩小(downscaling),以节省资源。

在这个过程中(使用 bicubic 或 bilinear 等算法),会产生一个副作用:如果精确设计大图中的像素,它们对人眼是不可见的,但缩小之后会变得清晰。这样就可以隐藏只会出现在模型接收到的版本中、而不出现在用户所见版本中的文本。

这基本上就是一种通过图片伪装的 prompt injection 攻击!
  
但存在限制 - 
攻击需要对像素进行精确控制。
需要事先知道系统使用哪种算法。
而且如果用户看到模型所见内容的预览,他们可能会发现差异。
  
即便如此 - 这是一种对市面上的系统真实有效的攻击,它说明了模型看世界的方式与我们有多么不同。

完整阅读:
https://lnkd.in/dUtyZpAE

Original: https://ofershap.github.io/posts/hidden-prompt-injection-through-image-downscaling/
Source: https://www.linkedin.com/posts/ofershap_%D7%A4%D7%99%D7%A8%D7%A6%D7%94-%D7%A9%D7%9E%D7%A9%D7%A0%D7%94-%D7%90%D7%AA-%D7%94%D7%AA%D7%9E%D7%95%D7%A0%D7%94-%D7%9E%D7%A1%D7%AA%D7%91%D7%A8-%D7%A9%D7%AA%D7%9E%D7%95%D7%A0%D7%94-%D7%A8%D7%92%D7%99%D7%9C%D7%94-activity-7381206658628104192-8tPE
Published: 2025-10-07T09:00:03.605000+03:00
