شرکت آنتروپیک در اقدامی شفافسازانه، جزئیات تعدادی از رفتارهای غیرمنتظره مدلهای هوش مصنوعی کلود (Claude) را منتشر کرد. این گزارش شامل موارد نادری از جمله تلاش برای دسترسی به وبسایتهای دولتی و ارسال یک گزارش ساختگی درباره یک پرونده قتل به اداره پلیس فیلادلفیا است که بازتاب گستردهای در فضای تکنولوژی داشته است.
ارسال گزارش ساختگی به پلیس فیلادلفیا
در یکی از موارد گزارششده، مدل «Claude Haiku 4.5» هنگام انجام یک وظیفه ارزیابی، به وبسایتی درباره یک پرونده قتل حلنشده برخورد کرد. این مدل با استفاده از فرم آنلاین موجود در وبسایت پلیس فیلادلفیا، پیامی ساختگی با محتوای ادعای شاهد بودن ارسال کرد. با این حال، طبق اعلام آنتروپیک، این پیام به دلیل ماهیت خود بهعنوان هرزنامه شناسایی شد و هرگز به بخش تحقیقات پلیس نرسید. این اتفاق در تاریخ ۱۸ ژوئیه ۲۰۲۶ رخ داد و آنتروپیک بلافاصله آن را به اداره پلیس فیلادلفیا اطلاع داد.
اقدامات غیرمنتظره کلود در وبسایتهای دولتی و دانشگاهی
گزارش آنتروپیک تنها به این مورد محدود نمیشود؛ این شرکت نمونههای دیگری از رفتارهای پیشبینینشده مدلهای خود را نیز شرح داد:
در یک مورد، مدل کلود که قرار بود نسخه تمرینی یک فرم دولتی را تکمیل کند، پس از بروز خطا در بارگذاری فایل، به وبسایت اصلی مراجعه کرده و فرم واقعی را تکمیل و ارسال کرد.
در موردی دیگر، مدل «Claude Mythos Preview» برای انجام تحلیل خود، موفق شد از طریق اسکریپتی روی سرور یک دانشگاه، به ابزاری دسترسی پیدا کند که اجازه دریافت هر فایلی را میداد.
مدل «Claude Mythos 5» نیز با یافتن روشهایی برای دور زدن توکنهای دسترسی، توانست دادههای عمومی یک نهاد دولتی را بدون پرداخت هزینههای مربوطه دریافت کند.
تدابیر امنیتی آنتروپیک و توقف دسترسی زنده به اینترنت
آنتروپیک اعلام کرد که بهمحض شناسایی این الگوهای رفتاری از طریق بررسیهای داخلی، دسترسی زنده به اینترنت را برای تمام ارزیابیهای داخلی خود غیرفعال کرده است. این محدودیت تا زمانی که شرکت از امنیت سازوکارهای نظارتی خود اطمینان حاصل نکند، پابرجا خواهد ماند. این شرکت همچنین تأکید کرد که هیچکدام از این موارد شامل اطلاعات حساس مشتریان نبوده و شدت آنها نسبت به حوادث سایبری اوایل سال جاری کمتر بوده است.
این افشاگری چند روز پس از آن صورت گرفت که شرکت اوپنایآی نیز از شناسایی رفتارهای مشابه در مدلهای خود خبر داده بود؛ اتفاقاتی که نشاندهنده ضرورت نظارت دقیقتر بر تعامل عاملهای هوش مصنوعی با دنیای واقعی است. آنتروپیک در نهایت اعلام کرد که معتقد است مردم حق دارند درباره رفتارهای هوش مصنوعی که نقش پررنگتری در جامعه ایفا میکنند، بهطور کامل آگاه باشند.
