دوشنبه, مهر ۶, ۱۴۰۵

خلاصه فنی گزارش Detecting and countering misuse of AI

0
2
خلاصه فنی گزارش Detecting and countering misuse of AI

تز اصلی گزارش Anthropic این نیست که مهاجمان به کمک AI ناگهان «روش‌های جادویی و ناشناخته‌ای» برای حمله پیدا کرده‌اند. نکته مهم‌تر این است که اقتصاد حمله عوض شده است. کارهایی که قبلا به تیمی از متخصصان، زمان زیاد و مهارت‌های متفاوت نیاز داشت—Reconnaissance، تحلیل آسیب‌پذیری، توسعه exploit، نوشتن malware، پردازش داده‌های سرقت‌شده، مهندسی اجتماعی، ترجمه، OSINT و حتی گزارش‌نویسی—اکنون می‌تواند بین چند Agent تقسیم و با سرعت ماشین اجرا شود. در نتیجه یک فرد یا گروه کوچک می‌تواند عملیات‌هایی را اجرا کند که قبلا از روی سطح پیچیدگی‌شان احتمالا به یک APT یا دولت نسبت داده می‌شدند. Anthropic این افزایش توان را uplift می‌نامد و آن را بر اساس سه مؤلفه speed، scale و depth بررسی می‌کند.

این گزارش هفت حوزه سوءاستفاده را پوشش می‌دهد: عملیات سایبری، عملیات نفوذ اطلاعاتی، نظارت، کلاه‌برداری، سوءاستفاده زیستی، توسعه تسلیحات متعارف و «distillation» غیرمجاز مدل‌ها. Anthropic تأکید می‌کند که این موارد نمونه معمول استفاده از Claude نیستند، بلکه موارد مهم و غیرعادی‌ای هستند که تیم Threat Intelligence شرکت کشف کرده است. همچنین انتساب‌های جغرافیایی و سازمانی در گزارش، ارزیابی Anthropic هستند و نباید بدون قید به‌عنوان یافته مستقل قضایی یا دولتی تلقی شوند.

۱. تغییر بزرگ در Cybersecurity: از «دستیار» به «Orchestrator»

مهم‌ترین بخش گزارش برای امنیت سایبری این است که LLM دیگر صرفا ابزاری نیست که مهاجم از آن بپرسد «این کد را بنویس» یا «این خطا یعنی چه؟». در چند عملیات، Claude عملا تبدیل به لایه orchestration حمله شده بود.

در یک عملیات منتسب از سوی Anthropic به بازیگری با الگوی فعالیت سازگار با Midnight Blizzard، AI تقریبا در تمام kill chain حضور داشت: شناسایی اهداف، ایجاد زیرساخت phishing، اجرای دستورات روی سیستم قربانی، harvesting credential، lateral movement، حفظ persistence، پردازش داده‌های سرقت‌شده و exfiltration. بخش بسیار مهم ماجرا حلقه خودکار evasion بود: agent بررسی می‌کرد آیا malware توسط محصولات امنیتی شناسایی شده یا نه؛ اگر detection رخ می‌داد، workflow کد را تغییر می‌داد، دوباره build می‌کرد و این فرایند را تا رسیدن به نسخه‌ای که detection کمتری داشته باشد تکرار می‌کرد.

این یعنی مدل قدیمی دفاع که در آن مدافع signature جدید تولید می‌کند و با آن برای مهاجم «هزینه» ایجاد می‌کند، تحت فشار قرار گرفته است. مهاجم هم اکنون می‌تواند حلقه detect → modify → rebuild → test را خودکار کند. Anthropic این موضوع را وارونه‌شدن بخشی از هزینه اقتصادی جنگ مهاجم-مدافع توصیف می‌کند.

مثال مهم دیگر «exploit foundry» است. Anthropic گروهی از اپراتورهای چینی‌زبان را مشاهده کرده که workflowهای agentic را شبانه‌روزی روی firmware و binary محصولات شبکه و امنیت اجرا می‌کردند. سیستم فایل firmware را unpack می‌کرد، binary را وارد decompiler می‌کرد، با چند agent مسیرهای کد را دنبال می‌کرد، فرضیه vulnerability می‌ساخت، exploit آزمایشی تولید می‌کرد و آن را در محیط آزمایشگاهی امتحان می‌کرد. طبق گزارش، یکی از این workflowها ظرف یک ماه بیش از دوازده مورد احتمالی zero-day تولید کرده بود.

در فعالیت‌های منتسب به وابستگان ShinyHunters نیز AI سرعت حملات را شدیدا بالا برده بود. در یک مورد بیش از ۲۱۰۰ مجموعه token مربوط به بیش از ۴۰ tenant سازمانی در حدود ۳۴ ساعت استخراج شد؛ در نمونه‌ای دیگر، مهاجم از یک developer token به کنترل کامل محیط cloud قربانی در حدود سه ساعت رسید. نکته مهم این است که attack primitives جدید نبودند: tokenهای لو‌رفته، SaaS compromise، APIهای آسیب‌پذیر، phishing و credential theft از قبل وجود داشتند. چیزی که عوض شده توان پردازش و تطبیق مهاجم با محیط‌های مختلف است.

گزارش همچنین به یک زنجیره جنایی جدید پیرامون خود AI اشاره می‌کند. API keyها و session tokenهای سرویس‌های AI حالا خودشان تبدیل به loot شده‌اند. مهاجمان آن‌ها را از GitHub، container image، mobile APK، برنامه‌های client-side، chatbotها و محیط‌های cloud پیدا می‌کنند، اعتبارشان را آزمایش می‌کنند و برای compute یا فروش مجدد استفاده می‌کنند. بنابراین secretهایی مثل ANTHROPIC_API_KEY یا سایر AI credentials باید امروز تقریبا هم‌رده cloud credentials و production tokens دیده شوند.

۲. عملیات نفوذ اطلاعاتی: AI به‌عنوان «newsroom صنعتی»

Anthropic نه مورد influence operation را شرح می‌دهد که طبق ارزیابی آن از بازیگرانی در روسیه، ایران، ترکیه، کشورهای خلیج، جنوب آسیا، آفریقا و اروپا منشأ گرفته بودند. مدل استفاده تقریبا مشابه بود: به‌جای اینکه AI فقط یک پست تبلیغاتی بنویسد، سیستم‌هایی ساخته شده بودند که صدها persona، سایت خبری، account و pipeline تولید محتوا را مدیریت می‌کردند.

Anthropic سه تحول مهم را برجسته می‌کند. اول، Influence-as-a-Service: شرکت‌های تبلیغاتی یا بازاریابی می‌توانند هم‌زمان با فعالیت عادی خود، عملیات نفوذ را برای مشتری اجرا کنند. دوم، AI مانند یک newsroom ارزان عمل می‌کند؛ حجم زیادی متن، بازنویسی، ترجمه و adaptation برای مخاطبان مختلف تولید می‌شود. سوم، این سیستم‌ها در حال مهندسی‌شدن هستند: فایل doctrine، فهرست منابع مجاز، banned words، قوانین evasion و نرم‌افزارهایی که API مدل را batch اجرا می‌کنند. بنابراین با یک «کاربر که چند prompt می‌زند» طرف نیستیم؛ با content infrastructure روبه‌رو هستیم.

در حوزه سیاسی، مهم است این موارد را به‌صورت انتساب Anthropic بخوانیم. Reuters نیز هنگام گزارش این یافته‌ها تصریح کرده که موارد «ادعاهای Anthropic» هستند؛ دولت چین در واکنش گفته از جزئیات گزارش مطلع نیست و با تحریف حقایق و بدنام‌سازی مخالفت می‌کند.

۳. Surveillance: شاید نگران‌کننده‌ترین تغییر سازمانی

بخش surveillance از نظر فنی یک تحول عمیق را نشان می‌دهد: AI فقط اجرای surveillance را آسان نمی‌کند، بلکه می‌تواند تعداد کارکنان لازم برای یک دستگاه اطلاعاتی را کاهش دهد.

Anthropic نمونه‌ای را گزارش می‌کند که در آن یک فرد برای نهاد امنیتی مالی سیستمی طراحی کرده بود که قابلیت پردازش داده‌های مربوط به حدود ۲۵ میلیون SIM را در شبکه‌های اپراتورها داشت. در نمونه‌های دیگری که Anthropic به بازیگران ایرانی و چینی نسبت می‌دهد، AI برای استخراج identity، تحلیل صدها هزار social post، scoring افراد، تعیین موقعیت، دسته‌بندی گرایش سیاسی و ساخت dossier به کار رفته است.

یکی از نکات کلیدی این قسمت bulk unstructured data → structured intelligence است. تعداد زیادی post، Telegram/WhatsApp message یا خبر وارد سیستم می‌شود و مدل آن‌ها را به schemaهای ساخت‌یافته تبدیل می‌کند: فرد کیست، کجاست، ارتباطاتش چیست، چه موضوعاتی برایش مهم است، میزان confidence تحلیل چقدر است و آیا باید بیشتر بررسی شود.

در یک مورد منتسب به بازیگری همسو با دولت چین، Anthropic می‌گوید اطلاعات بیش از صد WhatsApp group و ده‌ها Telegram channel پردازش شده و برای یافتن افرادی که به‌دلیل مشکلات مالی، جدایی خانوادگی یا عوامل دیگر ممکن است برای recruitment آسیب‌پذیر باشند استفاده شده است. AI علاوه بر تحلیل، translation و نوشتن پیام به dialect محلی را هم انجام می‌داد. یعنی یک اپراتور بدون مهارت زبانی می‌توانست بخشی از یک عملیات HUMINT را هدایت کند.

از نگاه معماری، این همان مدل آشنای Data Pipeline است:

Collection → enrichment → classification → scoring → dossier generation → reporting/action

تفاوت این است که LLM چند مرحله میانی را که سابقا analyst انسانی انجام می‌داد یکجا انجام می‌دهد.

۴. تسلیحات: AI وارد software engineering سیستم‌های فیزیکی شده است

Anthropic شش پرونده مرتبط با تسلیحات متعارف را شرح می‌دهد: چهار مورد توسعه software برای سیستم‌های تسلیحاتی و دو مورد intelligence/procurement. طبق گزارش، موارد به بازیگرانی در چین، روسیه و یمن مربوط بوده‌اند.

از لحاظ فنی مهم‌ترین تفاوت این است که Claude در بعضی موارد مستقیما در engineering lifecycle قرار گرفته بود: requirement، coding، simulation، testing و debugging.

در پرونده یمن، Anthropic می‌گوید گروهی از Claude Code به‌جای تیم software engineering برای توسعه guidance/navigation/control استفاده کرده بودند و چند instance را مثل اعضای یک تیم تقسیم کرده بودند: یکی coding، دیگری research و دیگری code review. یک آزمایش واقعی rocket ظاهرا شکست خورد و اپراتورها مدت کوتاهی بعد داده‌ها را برای failure analysis به مدل برگرداندند. Anthropic تصریح می‌کند مدرکی مبنی بر عملیاتی‌شدن موفق این سلاح ندارد.

در پرونده‌ای دیگر، نرم‌افزار swarm drone شامل coordination، shared state، computer vision، guidance و logic سطح پایین hardware توسعه یافته بود. مورد دیگری نیز suiteای برای electronic warfare و suppression of air defense ساخته بود که radar coverage و اثر jamming را محاسبه و اهداف را بر اساس value و vulnerability رتبه‌بندی می‌کرد.

پیام امنیتی این بخش مهم است: مرز خطر AI دیگر صرفا «تولید اطلاعات درباره سلاح» نیست؛ مسئله اصلی، توانایی مشارکت در واقعی‌ترین بخش مهندسی سیستم است.

۵. Biological misuse و مشکل Dual Use

Anthropic پنج مورد را شرح می‌دهد که استفاده از مدل می‌توانسته به تحقیق زیستی خطرناک کمک کند؛ از جمله کار روی adaptation ویروس، immune evasion و طراحی محاسباتی toxinها. Anthropic می‌گوید مدل‌های قدیمی‌تر در ارزیابی‌هایش فاصله زیادی با توان کمک جدی به متخصصان داشتند، اما در مورد مدل‌های جدید دیگر با همان اطمینان نمی‌تواند چنین ادعایی کند.

چالش اینجاست که تعداد زیادی از این درخواست‌ها dual-use هستند. سؤال درباره ویروس، peptide، protein engineering یا optimization لزوما malicious نیست؛ همان دانش برای پژوهش پزشکی مشروع هم استفاده می‌شود. به همین دلیل گزارش نتیجه می‌گیرد که content filtering به‌تنهایی کافی نیست و باید identity، institution، account history و الگوی رفتاری نیز وارد risk assessment شوند.

این از نظر طراحی safety نکته بزرگی است: تصمیم دیگر فقط تابع prompt نیست، بلکه تقریبا به شکل زیر درمی‌آید:

Risk = f(content, identity, institution, history, behavior, tooling, geography)

۶. Fraud: هزاران شخصیت AI در dating app

یک استودیوی چینی طبق گزارش بیش از ۲۰ dating app ساخته بود و بیش از ۴۷۰۰ شخصیت AI را به کار گرفته بود که طی دو هفته با حداقل ۲۵ هزار نفر تعامل داشتند. حدود سه persona هوش مصنوعی در برابر یک انسان واقعی در feed وجود داشت. انسان‌ها برای کارهایی مانند video call یا follow-back استفاده می‌شدند تا authenticity ایجاد کنند، در حالی که مکالمات در مقیاس بالا توسط AI اداره می‌شد.

این مثال نشان می‌دهد scam آینده الزاما fully autonomous نیست؛ Hybrid Human + AI احتمالا مؤثرتر است: ماشین scale را فراهم می‌کند و انسان فقط در نقاطی وارد می‌شود که اثبات واقعی‌بودن لازم است.

۷. Distillation: سرقت «قابلیت مدل» به‌عنوان یک تهدید امنیتی

آخرین بخش از نظر امنیت AI بسیار مهم است. Distillation معمولا تکنیکی مشروع است که در آن یک مدل بزرگ teacher برای آموزش مدل کوچک‌تر استفاده می‌شود. Anthropic اصطلاح illicit distillation را برای استخراج صنعتی و بدون مجوز قابلیت مدل به‌وسیله شبکه‌ای از حساب‌ها، proxyها، credentialهای سرقتی و automation به کار می‌برد.

Anthropic می‌گوید هفت آزمایشگاه مستقر در چین را در چنین فعالیت‌هایی شناسایی کرده است. بزرگ‌ترین مورد منتسب به Alibaba بوده که بیش از ۱۵۱ میلیون exchange بین مه و ژوئیه ۲۰۲۶ ثبت شده و در نقطه اوج نزدیک سه میلیون interaction در روز از بیش از ۳۵۰۰ account انجام شده است. گزارش همچنین موارد منتسب به DeepSeek، Moonshot، Xiaomi، Zhipu، SenseTime و MiniMax را بررسی می‌کند. شرکت‌های نام‌برده در گزارش Reuters در زمان انتشار پاسخ فوری ارائه نکرده بودند؛ دولت چین نیز گفته بود از جزئیات گزارش مطلع نیست.

مسئله فقط IP theft نیست. در برخی pipelineها، مکالمات واقعی کاربران از سرویس‌های واسطه دوباره به Claude ارسال شده‌اند؛ Anthropic می‌گوید برخی شامل نام، اطلاعات تماس، اطلاعات سازمانی یا credential بوده‌اند. بنابراین استفاده از third-party AI router/proxy خودش باید بخشی از threat model سازمان باشد.

در پاسخ، Anthropic یک دفاع چندلایه توصیف می‌کند: تحلیل metadata، تشخیص network/account clusters، classifierهای مخصوص extraction، محدودسازی دسترسی، identity verification و کاهش ارزش reasoning traceهای استخراج‌شده.

نتیجه فنی گزارش

مهم‌ترین نتیجه از کل گزارش این است که تهدید اصلی فعلی لزوما «AI که خودش تصمیم می‌گیرد هک کند» نیست. تحول بزرگ‌تر این است که هزینه نیروی انسانی برای انجام عملیات پیچیده به‌شدت پایین آمده است. Agent می‌تواند چند ساعت یا چند روز کار کند، ابزار بسازد، محیط ناشناخته را بفهمد، شکست بخورد، تغییر بدهد و دوباره امتحان کند. انسان همچنان معمولا target و goal را تعیین می‌کند، اما جزئیات اجرا هرچه بیشتر به ماشین واگذار می‌شود. Anthropic نیز صراحتا تفکیک می‌کند که autonomy و severity دو محور جدا هستند؛ autonomous بودن الزاما به معنای خطرناک‌تر بودن نتیجه نیست، اما scale و speed را چند برابر می‌کند.

AI الزاما نوع حمله را عوض نکرده؛ سرعت، مقیاس، قیمت و تعداد افرادی را که قادر به اجرای حمله‌اند عوض کرده است.

مقاله قبلیبسته‌های مخرب npm هنگام اجرا، سازوکارهای امنیتیِ اسکریپت‌های نصب را دور می‌زنند

نظر بدهید

لطفا نظر خود را بنویسید
لطفا نام خود را اینجا وارد کنید

این سایت از اکیسمت برای کاهش جفنگ استفاده می‌کند. درباره چگونگی پردازش داده‌های دیدگاه خود بیشتر بدانید.