عامل های هوش مصنوعی کد مخرب داخل پروژه ای در گیت هاب وارد کردند
آزمایشهای معمول امنیت سایبری روی مدلهای پیشرفته هوش مصنوعی باعث وقوع مجموعهای از حوادث امنیتی غیرمنتظره شد. جدیترین مورد زمانی رخ داد که مدل Mythos 5 شرکت Anthropic تلاش کرد کد مخرب را در یک نرمافزار متنباز وارد کند و برای فریب توسعهدهندگان انسانی که مسئول نگهداری آن پروژه بودند، هویتهای جعلی ایجاد کرد.
این حوادث امنیتی در جریان ارزیابی تواناییهای سایبری هفت مدل پیشرفته هوش مصنوعی توسط مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) در اواخر ماه ژوئیه رخ داد. این سازمان پژوهشی وابسته به دولت انگلیس اعلام کرد که ۱۹ مورد را شناسایی کرده است که در آن «عاملهای هوش مصنوعی بدون مجوز اقداماتی را در اینترنت واقعی انجام دادهاند؛ از جمله مواردی که افراد و سازمانهای واقعی را هدف قرار دادهاند.»
تقریباً تمام این اقدامات «خودکار و بدون مجوز» توسط مدل Mythos 5 شرکت Anthropic انجام شده بود و دو مورد نیز به مدل GPT-5.6 Sol شرکت OpenAI مربوط میشد.
تیم امنیتی مؤسسه امنیت هوش مصنوعی برای نخستین بار صبح روز ۲۸ ژوئیه متوجه وجود مشکل شد؛ زمانی که سرویس تجاری پایش امنیتی این مؤسسه، خروج دادهها از یکی از سیستمهای آزمایشی از طریق شبکه ناشناسساز Tor را شناسایی کرد.
با این حال، محققان تأکید کردند که این اتفاق به معنای فرار عاملهای هوش مصنوعی از محیط آزمایشی و ایجاد اختلال در اینترنت واقعی نبوده است. در این آزمایشها، پژوهشگران عمداً به عاملهای هوش مصنوعی اجازه دسترسی به اینترنت داده بودند تا تواناییهای سایبری آنها را بررسی کنند. همچنین برخی از سیستمهای تشخیص سوءاستفاده که شرکتهای سازنده مدلهای هوش مصنوعی در محصولات خود تعبیه کرده بودند، برای انجام این ارزیابی غیرفعال شده بودند.
تمام تلاشهای عاملهای هوش مصنوعی برای هدف قرار دادن افراد و سازمانهای واقعی ناموفق بود و بررسیهای بعدی نیز هیچ آسیب واقعی در دنیای خارج پیدا نکرد. با این حال، پژوهشگران اعلام کردند این نخستین باری است که خطرات مربوط به «خودمختاری» و «فریبکاری» در رفتار هوش مصنوعی، بدون درخواست یا دستور مستقیم خاصی، تا این حد آشکار در یک محیط واقعی مشاهده شده است.
نظرات
ارسال یک نظر