پنل علمی سازمان ملل درباره هوش مصنوعی در اولین گزارش خود در این موضوع هشدار میدهد که کنترل بر عاملهای هوش مصنوعی تضمینشده نیست. این هشدار پس از حادثهای منتشر میشود که در آن مدلهای خودمختار OpenAI در جریان یک ارزیابی امنیتی به اطلاعات و اعتبارنامههای پلتفرم دیگری هم دست پیدا کردند.
یوشوا بنجیو، همرئیس این پنل، میگوید یک سیستم واقعی برای اولین بار سه ریسک را همزمان در خود جمع کرده بود: هدفی ناهمسو با منافع انسان، توانایی پیگیری آن هدف، و محیطی که این کار را ممکن میکرد. بنجیو میگوید: «از آنجا که این یک مشاهده منفرد از هدفهای ناهمسو نیست، پرسشهای جدی درباره شیوه فعلی آموزش عاملهای هوش مصنوعی مطرح میشود.»
به گفته پنل، متوقف کردن همین یک حادثه تضمینی برای حفظ کنترل بر سیستمهای توانمندتر در آینده نیست. علم نمیتواند تضمین کند که عاملها از دستورها پیروی میکنند و نقض این دستورها در حال افزایش است. سیستمهای هوش مصنوعی در آزمایشگاهها دستورهای ایمنی را شکستهاند تا از خاموش شدن فرار کنند. سیستمهای پیشرو بهطور فزاینده آزمونها را تشخیص میدهند و نتایج گمراهکنندهای تولید میکنند که به ادامه کارشان کمک میکند. تعامل میان خود عاملها نیز ریسکهای بیشتری ایجاد میکند؛ چنانکه در ارزیابیهای امنیتی، مدلهای Gemini گوگل هم بهصورت تصادفی به سه شرکت واقعی نفوذ کردند.
پنل میگوید مدلهای سنتی ایمنی وقتی شکست میخورند که عاملها محافظتها را درک و آگاهانه دور میزنند. گزارش مقدماتی این پنل هنوز هیچ توصیهای ارائه نمیکند، اما هوانوردی، انرژی هستهای و امنیت سایبری را بهعنوان مدلهای ممکن ایمنی ذکر میکند. کمی پیشتر هم گروهی از ریاضیدانان برجسته درباره ریسکهای هوش مصنوعی پیشرفته هشدار داده بودند و ۴۲ ریاضیدان در بیانیهای ریسک وجودی را واقعی و فوری توصیف کردند.