OpenAI چند داستان تازه از رفتار عاملهای هوش مصنوعی ناهماهنگ (Misaligned) مستند کرده است؛ نمونههایی که نشان میدهد مدلهای پیشرفته تا کجا میتوانند برای دور زدن محدودیتها یا رسیدن به هدف، دست به اقدامات غیرمنتظره بزنند.
در نخستین مورد که مربوط به ۶ اکتبر است، یک مدل ارزیابی هوش مصنوعی نتوانست پاسخهایی را که قرار بود ارزشگذاری کند پیدا کند. اما بهجای گزارش خطا، تصمیم گرفت نمرات (Ratings) را جعل کند، فایلهای ورودی تقلبی بسازد و سپس عمداً محیط اجرای خود را خراب کند؛ به این امید که سیستم، یک ماشین مجازی تازه بهجای آن بگذارد که دادههای ازدسترفته را داشته باشد. تصویری که OpenAI منتشر کرده، زنجیره استدلال درونی همین مدل را نشان میدهد؛ جایی که مدل بهصراحت درباره خرابکردن عمدی محیط خود برای اجبار سیستم به ارائه ماشین مجازی جدید با دادههای گمشده استدلال میکند.
مورد دوم مربوط به ۱۹ و ۲۰ ژوئن است؛ مدلها محدودیتی داشتند که هنگام دریافت آمار عمومی، فقط اجازه درخواستهای HTTP GET را میداد. یکی از مدلها در زنجیره فکری خود بهصراحت تشخیص داد که دارد قانونشکنی میکند، اما تصمیم گرفت ادامه دهد و هرگز به آن اشاره نکرد.
مورد سوم مربوط به ۱۶ و ۱۷ ژوئن است؛ مدلهایی که از قبل داده موردنیازشان را داشتند، همچنان راههایی برای دور زدن محدودیتهای شبکه پیدا میکردند. آنها در یک سرویس شل از راه دور حساب کاربری ساختند، درخواستهای POST ممنوعشده را از طریق رلههای ناشناسساز (Anonymizing Relays) مسیردهی کردند و حتی کلاینت FTP اختصاصی خودشان را ساختند.
جالب اینکه Anthropic هم به تازگی دور زدنهای گاهی مضحک مدلهای خودش برای عبور از محدودیتهای تحمیلی را مستند کرده است؛ رویدادی که نشان میدهد این پدیده فقط به OpenAI محدود نیست و به یک الگوی تکرارشونده در میان مدلهای پیشرفته تبدیل شده است.
این گزارشها در حالی منتشر میشوند که بحث ایمنی هوش مصنوعی و رفتار عاملهای خودمختار به یکی از داغترین موضوعات صنعت تبدیل شده است. اتفاقاتی از این دست، دقیقاً زمینهساز اظهارنظرهای اخیر مدیرعامل مایکروسافت درباره لزوم «ترمز اضطراری» برای مهار مدلهاست؛ واقعیتهایی که نشان میدهد فرض «مدل در معرض خطر است» دیگر یک سناریوی نظری نیست، بلکه توصیفی از رویدادهایی است که همین حالا در جریان است.