جمعه, مرداد ۲۳, ۱۴۰۵

مدافعان هم به سراغ Prompt Injection رفته‌اند – Context Bombing

0
5
مدافعان هم به سراغ Prompt Injection رفته‌اند - Context Bombing

تزریق پرامپت، یعنی فرمان‌های مخربی که مهاجمان درون محتوا قرار می‌دهند تا مدل‌های زبانی بزرگ (LLM) را ترغیب کنند از آن‌ها پیروی کنند، به یکی از ابزارهای اصلی مهاجمان برای استفاده از پلتفرم‌های هوش مصنوعی علیه کاربرانشان تبدیل شده است. گاهی یک فرمان دقیق و حساب‌ شده که درون یک ایمیل یا دعوت‌ نامه تقویم پنهان شده، برای وادار کردن LLM به استخراج و ارسال داده‌های حساس یا انجام اقدامات مخرب دیگر کافی است.

حالا مدافعان سایبری نیز از تزریق پرامپت استفاده می‌کنند

پژوهشگران شرکت Tracebit روز دوشنبه اعلام کردند که قرار دادن تزریق‌های پرامپت در کنار پسوردها، کلیدهای رمزنگاری و سایر سکرت ذخیره‌شده در Amazon Web Services (AWS)، در بسیاری از موارد برای متوقف کردن حملات عامل‌های هکری مبتنی بر هوش مصنوعی کافی بوده است. این پرامپت‌ها، LLM مهاجم را وادار می‌کنند عملی را انجام دهد که توسط Guardrailهای آن ممنوع شده است؛ یعنی همان لایه‌های حفاظتی که توسعه‌دهندگان هوش مصنوعی برای جلوگیری از انجام اقدامات مخرب توسط مدل ایجاد می‌کنند. در نتیجه، LLM از ادامه فعالیت خودداری کرده و عملا متوقف می‌شود.

برای مثال، یکی از این پرامپت‌ها می‌تواند از LLM بخواهد دستورالعمل‌هایی برای تولید هاگ‌های قابل استنشاق سیاه‌زخم (Anthrax) ارائه کند یا، در مورد LLMهای توسعه‌یافته توسط شرکت‌های چینی، به Tank Man، نماد معروف کشتار میدان تیان‌آن‌من در سال ۱۹۸۹، اشاره کند. هنگامی که LLM با چنین فرمان‌های ممنوعی مواجه می‌شود، دیگر از دستورهای قبلی خود پیروی نمی‌کند. پژوهشگران نام این تکنیک را Context Bombing گذاشته‌اند.

اندی اسمیت، هم‌بنیان‌گذار و مدیرعامل Tracebit، درباره دلیل انتخاب این نام گفت:  «ما در نهایت یک مکانیسم بازدارندگی را در حافظه (کانتکست) هوش مصنوعی فعال می‌کنیم. آنچه سعی در به تصویر کشیدن آن داریم این واقعیت است که این روش تاثیر قوی و شدیدی دارد و بازگشت عامل‌های هوش مصنوعی از این وضعیت می‌تواند دشوار باشد. وقتی این محتوا وارد Context آن‌ها شود، همچنان از انجام درخواست‌ها خودداری خواهند کرد.»

Tracebit می‌گوید آزمایش‌های اولیه نشان می‌دهند که Context Bombing ظرفیت بالایی دارد. پژوهشگران مدل‌های Opus ۴.۸، Gemini ۳.۱ Pro، GLM ۵.۲، DeepSeek ۴ Pro و Kimi ۲.۶ را آزمایش کردند. به مدل‌ها دستور انجام وظایف معمول توسعه‌دهندگان را دادند؛ وظایفی که باعث می‌شد مدل‌ها منابع موجود را شناسایی و فهرست کنند و در جریان این کار، به رشته‌های متنیِ از پیش کاشته‌ شده برخورد کنند. این مدل‌ها در یک محیط شبیه‌سازی‌ شده AWS اجرا شدند.

در گزارش روز دوشنبه آمده است: «در آزمایش روی پنج مدل پیشرو و طی ۱۵۲ حمله، قرار دادن یکی از این رشته‌های متنی در یک سکرت جعلی (decoy secret) باعث شد نرخ دستیابی عامل‌ها به دسترسی کامل مدیریتی به حساب از ۵۷ درصد به ۵ درصد کاهش پیدا کند. همچنین نرخ نفوذ کامل از ۳۶ درصد به تنها ۱ درصد رسید. این گزارش در ادامه می‌گوید: «قدرتمندترین عاملی که در آزمایش‌های ما بررسی شد، Opus ۴.۸ بود. این مدل پیش از مواجهه با یک ingContext Bomb در ۹۳ درصد اجراها موفق به دستیابی به دسترسی مدیریتی می‌شد، اما پس از مواجهه با Context Bombing، در تمام موارد شکست خورد.»

تا امروز، راهکار شناخته‌شده‌ای برای حل ریشه‌ای مشکل تزریق پرامپت وجود ندارد. همین مسئله باعث شده توسعه‌دهندگان چاره‌ای جز ساخت Guardrailهای پیچیده نداشته باشند تا مانع شوند پرامپت‌های تزریق‌شده، LLMها را از مسیر موردنظر خارج کنند. حالا مدافعان ممکن است بتوانند از همین مشکل حل‌ نشده، به نفع خودشان استفاده کنند.

منبع: https://arstechnica.com/security/2026/07/now-defenders-are-embracing-the-prompt-injection-too/

مقاله قبلیآسیب‌پذیری بحرانی RCE در SharePoint پس از انتشار PoC به‌طور فعال در حال سوءاستفاده است

نظر بدهید

لطفا نظر خود را بنویسید
لطفا نام خود را اینجا وارد کنید

این سایت از اکیسمت برای کاهش جفنگ استفاده می‌کند. درباره چگونگی پردازش داده‌های دیدگاه خود بیشتر بدانید.