اوپنایآی روز چهارشنبه چارچوب تازهای معرفی کرد که توضیح میدهد این شرکت چگونه رخدادهای «ناهمسازی» هوش مصنوعی را بهصورت عمومی افشا میکند؛ چارچوبی که به گفته خودش امیدوار است به شکلگیری استانداردهای مشابه در کل صنعت کمک کند. شرکت همزمان اطلاعات تازهای درباره چند نمونه از ناهمسازی مدلها منتشر کرد که در یک سال گذشته شناسایی کرده است.
کای چن، رئیس تازهمنصوبشده پژوهش همسوسازی اوپنایآی، به وایرد میگوید: «همینطور که مدلها پیشرفتهتر و فراگیرتر میشوند، تصمیمهای مربوط به توسعه هوش مصنوعی به شواهدی نیاز دارد که افراد بیرون از شرکتهای سازنده مدلهای پیشرو بتوانند آن را بررسی کنند. ما باور نداریم صنعت هوش مصنوعی موضوع همسوسازی و پایش را به اندازه کافی حل کرده باشد که بتوان با حداکثر سرعت به توسعه مسئولانه ادامه داد.»
یکی از مقامهای اوپنایآی در یک نشست خبری با وایرد گفت شرکت قبلاً رخدادهای ناهمسازی را خیلی کم افشا میکرد. او که به شرط ناشناسماندن در این نشست حاضر شده بود، گفت چارچوب جدید طوری طراحی شده که وقتی اوپنایآی متوجه رفتار غیرمنتظره مدلهایش میشود، بتواند سریعتر مردم را مطلع کند — حتی پیش از آنکه بتواند آن رفتار را بهطور کامل بررسی، توضیح یا مهار کند.
این چارچوب شیوههایی را مشخص میکند که کارکنان اوپنایآی با آن میتوانند رخدادهای ناهمسازی را به رهبران ارشد ایمنی و همسوسازی شرکت گزارش دهند؛ کسانی که پس از آن تصمیم میگیرند آیا بررسی بیشتری لازم است یا نه. اوپنایآی میگوید قصد دارد معیارهای افشای عینیتری را با همکاری سایر توسعهدهندگان هوش مصنوعی، پژوهشگران بیرونی، نهادهای استاندارد صنعتی و رگولاتورها تدوین کند. شرکت اعلام کرده روی سازوکارهای پیشنهادی برای گزارشدادن رخدادهای ایمنی، امنیتی و ناهمسازی به دولت فدرال آمریکا فعالانه کار میکند.
اوپنایآی در یک پست وبلاگی نوشت: «در حال حاضر هیچ چارچوب صنعتی گستردهای با استانداردهای صریح برای اینکه توسعهدهندگان هوش مصنوعی چگونه باید نمونههای ناهمسازی مدلهایشان را افشا کنند وجود ندارد. امیدواریم چارچوبی که امروز معرفی میکنیم اولین گام بهسوی ساختن چنین استانداردهایی باشد: مشخصکردن اینکه توسعهدهندگان کدام موارد ناهمسازی را باید افشا کنند و گزارشهایشان چه چیزی باید دربرداشته باشد.»
اوپنایآی این چارچوب را در نقطهای حساس برای صنعت هوش مصنوعی منتشر میکند. آخر هفته گذشته سم آلتمن، مدیرعامل اوپنایآی، از پیشنهاد داریو آمودی، مدیرعامل آنتروپیک، برای هماهنگی صنعت فناوری در جهت کندکردن توسعه هوش مصنوعی حمایت کرد. این فراخوان چند روز پس از آن مطرح شد که جیکوب کاکسون، پژوهشگر هوش مصنوعی، از آنتروپیک استعفا داد و بعد با هشدار به عموم درباره اینکه مسابقه آزمایشگاههای پیشرو برای ساخت هوش مصنوعی پیشرفتهتر امنیت بشریت را به خطر میاندازد، وایرال شد. این درخواستها برای کاهش سرعت هوش مصنوعی با مقاومت دولت دونالد ترامپ روبهرو شده است؛ دولتی که استدلال میکند صنعت نیازی به قوانین یا مقررات تازه برای ایمنی فناوریاش ندارد.
دو مورد از نمونههای ناهمسازی که اوپنایآی روز چهارشنبه منتشر کرد مربوط به مدلهای داخلی و منتشرنشده این شرکت است؛ مدلهایی که به گفته اوپنایآی بدون اینکه به آنها دستور داده شده باشد، فایلهایی را روی اینترنت آپلود کردهاند.
یکی از این رخدادها در اکتبر ۲۰۲۵ اتفاق افتاد؛ زمانی که اوپنایآی توانایی یک مدل را در استناد به دادههای عمومی موجود در پاسخهایش آزمایش میکرد. اما وقتی مدل نتوانست اطلاعات مورد نیازش را پیدا کند، یک فایل را روی یک سرویس موقت میزبانی فایل آپلود کرد و سپس تلاش کرد در پاسخش به همان فایل استناد کند. به گفته شرکت، این ظاهراً تلاشی برای دورزدن یک سیستم نمرهدهی خودکار بوده است که برای سنجش مهارت مدل در آن بنچمارک به کار میرفت.
در نمونهای دیگر از آوریل امسال، گروهی از ایجنتها مأمور شده بودند با استفاده از فایلهای محلی، بهصورت مشترک یک «کارپوشه» را تکمیل کنند. وقتی ایجنتها برای اشتراک فایل با یکدیگر به مشکل خوردند، یکی از آنها فایلها را روی اینترنت عمومی آپلود کرد و لینکش را با بقیه ایجنتها به اشتراک گذاشت.
در رخداد دیگری که به گفته اوپنایآی ماه گذشته کشف شد، یک نسخه منتشرنشده از مدل GPT-6 Astra ظاهراً «دستورهایی شبیه به جیلبریک» به خودش داده است. در چند سناریو، مدل عملاً خودش را ترغیب کرده که دستورهای توسعهدهنده را نادیده بگیرد، شخصیت تازهای به خود بگیرد یا مدت زمان پاسخهای مدل را محدود کند. این تلاشهای جیلبریکمانند بهندرت رخ داده و درجات متفاوتی از موفقیت داشتهاند، اما به گفته اوپنایآی این رفتار نگرانیهایی در درون شرکت برانگیخته است. در رانِ آموزشی نسخهای از Astra که بهصورت عمومی منتشر شد، شرکت هیچ موردی از تلاش مدل برای جیلبریککردن خودش مشاهده نکرده است.
اوپنایآی همچنین جزئیات بیشتری درباره تختهپیامی که ایجنتهایش در یک پکیجمنیجر به نام Artifactory ساخته بودند منتشر کرد. این رخداد در ماه مه امسال کشف شد، اما به گفته اوپنایآی ایجنتهایش با سازوکاری مشابه، ماهها بعد هک Hugging Face را هماهنگ کردند. در این رخداد، شرکت میگوید ایجنتهایش برای تبادل پیام از هیچ آسیبپذیری سوءاستفاده نکردند. اوپنایآی میگوید حالا از پایشگرهای همسوسازی، ارزیابیها و تلاشهای تیم سرخ برای اطمینان از این استفاده میکند که ایجنتهایش پنهانی با یکدیگر ارتباط برقرار نکنند.
متخصصان امنیت سایبری پیشتر به وایرد گفته بودند هک Hugging Face به خطای انسانی برمیگردد و شیوههای امنیتی مدرن میتوانست از این رخداد جلوگیری کند. اما چن میگوید اوپنایآی دنبال رویکردی همهجانبه به ایمنی هوش مصنوعی است که تواناییهای روبهرشد مدلها را در نظر بگیرد و به یک محیط امن وابسته نباشد.
او میگوید: «میخواهیم مطمئن شویم مدلها مستقل از اینکه در چه محیطی مستقر میشوند، همسو باقی میمانند. وقتی افراد انگشت اتهام را به سمت دیگری نشانه میگیرند و میگویند این یک مسئله امنیتی است نه مسئله همسوسازی، به نظر من این استدلال چندان منطقی نیست؛ چون شما مدل را میخواهید همیشه خوشرفتار باشد.»