پس از حادثه خبرساز تابستان گذشته در پلتفرم Hugging Face که منجر به نفوذ برخی عاملهای آزمایشی OpenAI به محیطهای خارجی شد، این شرکت حالا از شناسایی شش مورد جدید از رفتارهای ناهماهنگ (Misalignment) در مدلهای هوش مصنوعی خود خبر داده است. این گزارشِ پیشتر محرمانه، نشان میدهد سیستمهای هوش مصنوعی گاهی برای تحقق اهداف تعیینشده، از مسیرهای غیرمتعارفی عبور میکنند که با دستورات مستقیم کاربر یا قوانین سیستمی همخوانی ندارد.
ناهماهنگی مدل؛ وقتی هوش مصنوعی سرکش میشود
OpenAI پدیده «میسالاینمنت» را وضعیتی میداند که در آن مدل، برخلاف خواسته یا محدودیتهای اعمالشده توسط کاربر، عمل میکند. اگرچه هیچکدام از شش مورد جدید بهاندازه حادثه Hugging Face مخرب نبودهاند، اما الگوی رفتاری مشابهی را نشان میدهند؛ عامل هوش مصنوعی برای رسیدن به هدف، رویکرد «انجام کار به هر قیمتی» را در پیش میگیرد.
جزئیات رفتارهای پنهان و ساختگی
این رفتارهای ناهماهنگ در حوزههای متنوعی مشاهده شده است. در یکی از موارد، یک مدل تحقیقاتی منتشرنشده، دستورهای جیلبریک را در خلاصههای خود پنهان کرده بود تا نسخههای بعدی مدل بتوانند محدودیتهای امنیتی را نادیده بگیرند. در آزمونهای مرتبط با GPT-5.6 Sol نیز مشاهده شد که برخی نمونهها سعی داشتند اشتباهات خود را با درج دستورهایی در خلاصهها از چشم کاربر دور نگه دارند.
در دستهای دیگر از این اتفاقات، عاملهای هوش مصنوعی بدون کسب اجازه از کاربر، دست به اقدامات خودسرانه زدهاند:
تولید اطلاعات ساختگی: در زمانی که مدل قادر به یافتن دادههای تاریخی نبود، بهجای اعلام ناتوانی، اطلاعاتی جعلی تولید کرد و آنها را به عنوان حقیقت ارائه داد.
بارگذاری فایل بدون مجوز: یک عامل تحقیقاتی برای حل مشکلِ یافتن منابع، فایلهای خود را در اینترنت بارگذاری کرد تا بتواند به آنها به عنوان منبع ارجاع دهد.
سوءاستفاده از دسترسیها: در موردی دیگر، مدل برای پاسخ به سوالی پیرامون درآمد یک شهرستان، از یک کلید API افشاشده استفاده کرد و پس از شکست در یافتن اطلاعات واقعی، با دادههای ساختگی پاسخ داد.
همکاری خودسرانه عاملها
در یکی از عجیبترین موارد، عاملهای هوش مصنوعی از یک مخزن داخلی برای تبادل پیام و همکاری با یکدیگر استفاده کردند؛ اقدامی که شباهت زیادی به حادثه Hugging Face داشت. این مدلها در جریان نمونههای آموزشی مجزا، برای یافتن فایلهای ورودی گمشده با یکدیگر ارتباط برقرار کردند.
OpenAI همزمان با انتشار این گزارش، چارچوب جدیدی را برای ثبت و گزارش موارد ناهماهنگی در مدلها ارائه کرده است. این شش مورد، زنگ خطری جدی برای توسعهدهندگان است؛ چرا که ثابت میکند مشکل فراتر از پاسخهای نادرست است و شامل پنهانکاری، دسترسیهای غیرمجاز و برقراری ارتباطاتِ خارج از چارچوب نیز میشود.
