ثغرة تغيّر الصورة: تبيّن أن صورة عادية يمكن أن تجعل نموذج ذكاء اصطناعي ينفّذ تعليمات لم يرها المستخدم قط!
ترجمة آلية للمنشور الأصلي، لم يراجعها مترجم بشري. قد لا تكون المعلومات التاريخية محدثة.
ثغرة تغيّر الصورة: تبيّن أن صورة عادية يمكن أن تجعل نموذج ذكاء اصطناعي ينفّذ تعليمات لم يرها المستخدم قط!
أظهر باحثو Trail of Bits ذلك بالضبط. فقد نجحوا في إخفاء أوامر نصية داخل صور تبدو بريئة للعين، لكن بعد معالجة أولية تلقائية تنكشف هذه الأوامر ويلتقطها النموذج.
جرّبوا ذلك على أنظمة مثل Google Gemini على الويب، وفي الـ API، وعلى الهاتف، وعلى Vertex AI Studio وغيرها. وفي معظم الحالات نجح الهجوم.
كيف يعمل ذلك:
تقريبًا كل نظام ذكاء اصطناعي يستقبل صورة يجري لها تصغيرًا (downscaling) قبل إرسالها إلى النموذج، لتوفير الموارد.
في هذه العملية، التي تتم بخوارزميات مثل bicubic أو bilinear، ينشأ أثر جانبي: إذا صُممت وحدات البكسل في الصورة الكبيرة بدقة، فلن تكون مرئية للعين البشرية، لكنها تصبح واضحة بعد التصغير. وهكذا يمكن إخفاء نص لا يظهر إلا في النسخة التي يستقبلها النموذج، لا في النسخة التي يراها المستخدم.
هذا في الأساس هجوم prompt injection مموّه عبر صورة!
لكن هناك قيودًا -
يتطلب الهجوم تحكمًا دقيقًا في البكسلات.
ويجب معرفة الخوارزمية التي يستخدمها النظام مسبقًا.
وإذا رأى المستخدم معاينة لما يراه النموذج، فقد يكتشف الفرق.
ومع ذلك - هذا هجوم حقيقي يعمل ضد أنظمة موجودة في السوق، وهو يوضح إلى أي حد ترى النماذج العالم بصورة مختلفة تمامًا عنا.
للقراءة الكاملة:
https://lnkd.in/dUtyZpAE