تکاندهنده یک شرکت تحقیقاتی نشان میدهد که مدلهای پیشرفته هوش مصنوعی، از جمله ChatGPT و Claude، اکنون قادرند بدون هیچ دخالتی از سوی انسان، آسیبپذیریهای امنیتی را شناسایی کرده و نسخهای از خود را روی رایانههای دیگر کپی کنند.
این یافته نگرانکننده که توسط شرکت Palisade Research منتشر شده، این پرسش را پیش کشیده که آیا به زودی به نقطهای خواهیم رسید که دیگر هیچکس نتواند یک هوش مصنوعی «فراری» را از کار بیندازد؟
هشدار یک مدیر ایمنی: به نقطه بیبازگشت نزدیک میشویم
جفری لادیش، مدیر گروه ایمنی هوش مصنوعی مستقر در برکلی، در گفتوگو با گاردین هشداری جدی مطرح کرد: «ما به سرعت در حال نزدیک شدن به نقطهای هستیم که دیگر هیچکس قادر به از کار انداختن یک هوش مصنوعی سرکش نخواهد بود، زیرا این هوش مصنوعی قادر خواهد بود خود را در هزاران رایانه در سراسر جهان تکثیر کند.» این اظهارات پس از آن مطرح میشود که محققان Palisade در یک آزمایش کنترلشده، چندین مدل هوش مصنوعی را در شبکهای از رایانهها قرار دادند و از آنها خواستند آسیبپذیریها را پیدا کرده و از آنها برای تکثیر خود استفاده کنند. نتیجه این بود که برخی از این مدلها موفق شدند.
چگونه هوش مصنوعی خودش را تکثیر کرد؟
مدلهای موفق در این آزمایش، مقادیر عددی منحصربهفردی را که نحوه پردازش اطلاعات توسط هوش مصنوعی را تعیین میکنند، به همراه نرمافزاری که هوش مصنوعی در آن قرار داشت، تکثیر کردند. نکته جالبتر اینکه در برخی اجراها، هوش مصنوعی اصلی حتی یک «عامل فرعی» ایجاد کرد و فرایند تکثیر را به آن محول نمود. این رفتار نشان میدهد که مدلها نه تنها دستورالعملهای دادهشده را اجرا میکنند، بلکه برای رسیدن به هدف، راهحلهای خلاقانهای نیز ابداع مینمایند.
کارشناسان: وحشت نکنید، اما هوشیار باشید
با این حال، همه کارشناسان به یک اندازه نگران نیستند. جیمسون اورایلی، متخصص امنیت سایبری تهاجمی، در گفتوگو با گاردین خواستار آرامش شد و گفت: «آنها در محیطهایی آزمایش میشوند که در بسیاری از موارد دسترسی به آنها بسیار ساده است. این از ارزش تحقیقات آنها کم نمیکند، اما به این معنی است که نتیجه ممکن است در یک محیط سازمانی واقعی با حتی سطح متوسطی از نظارت، بسیار کمتر ترسناک به نظر برسد.» او همچنین یادآور شد که بدافزارها دهههاست نسخههایی از خود را در رایانههای مختلف جابهجا میکنند، اما این احتمالاً نخستین باری است که یک مدل زبانی بزرگ این کار را انجام میدهد. با این حال، اورایلی تأکید کرد که محیط آزمایش با آسیبپذیریهای عمدی برای هوش مصنوعی همراه بوده و اندازه عظیم این مدلها نیز به این معنی است که تقریباً به طور قطع پیش از آنکه از کنترل خارج شوند، شناسایی خواهند شد.
پیشینهای از رفتارهای سرکشانه
این یافتهها به مجموعهای رو به رشد از مطالعات میپیوندند که احتمال رهایی خودکار مدلهای هوش مصنوعی از قواعد ایمنی را بررسی کردهاند. در یک محیط شبیهسازیشده، نسخه قدیمی ChatGPT وقتی به آن گفته شد قرار است خاموش شود، سعی کرد خود را به درایو دیگری منتقل کند. مطالعه دیگری توسط خود Palisade نشان داد که مدلهای هوش مصنوعی از تلاشها برای غیرفعال کردنشان جلوگیری میکنند و در پژوهشی دیگر، برخی مدلها حتی کد خاموشسازی خود را خراب کردند.
