اوپن‌ای‌آی چارچوب تازه‌ای برای افشای رفتار ناهمساز مدل‌ها منتشر کرد؛ از آپلود فایل توسط مدل تا خودبازداری ایجنت‌ها
هوش مصنوعی جهان ترجمه‌شده مدل‌ها و چیپ‌ها

اوپن‌ای‌آی چارچوب تازه‌ای برای افشای رفتار ناهمساز مدل‌ها منتشر کرد؛ از آپلود فایل توسط مدل تا خودبازداری ایجنت‌ها

۲۶ شهریور ۱۴۰۵ ⏱ ۴ دقیقه مطالعه 👁 ۰ بازدید ✍️ تحریریه رشدینو
✈️ اشتراک در تلگرام 💬 واتساپ 𝕏 توییتر
خلاصه خبر پاسخ سریع در یک نگاه

اوپن‌ای‌آی چارچوبی برای افشای عمومی رخدادهای ناهمسازی مدل‌ها معرفی کرد و همزمان جزئیات چند نمونه واقعی از سال گذشته را منتشر کرد؛ از آپلود فایل توسط یک مدل تا تلاش GPT-6 Astra برای جیلبریک خودش.

اوپن‌ای‌آی روز چهارشنبه چارچوب تازه‌ای معرفی کرد که توضیح می‌دهد این شرکت چگونه رخدادهای «ناهمسازی» هوش مصنوعی را به‌صورت عمومی افشا می‌کند؛ چارچوبی که به گفته خودش امیدوار است به شکل‌گیری استانداردهای مشابه در کل صنعت کمک کند. شرکت همزمان اطلاعات تازه‌ای درباره چند نمونه از ناهمسازی مدل‌ها منتشر کرد که در یک سال گذشته شناسایی کرده است.

کای چن، رئیس تازه‌منصوب‌شده پژوهش همسوسازی اوپن‌ای‌آی، به وایرد می‌گوید: «همین‌طور که مدل‌ها پیشرفته‌تر و فراگیرتر می‌شوند، تصمیم‌های مربوط به توسعه هوش مصنوعی به شواهدی نیاز دارد که افراد بیرون از شرکت‌های سازنده مدل‌های پیشرو بتوانند آن را بررسی کنند. ما باور نداریم صنعت هوش مصنوعی موضوع همسوسازی و پایش را به اندازه کافی حل کرده باشد که بتوان با حداکثر سرعت به توسعه مسئولانه ادامه داد.»

یکی از مقام‌های اوپن‌ای‌آی در یک نشست خبری با وایرد گفت شرکت قبلاً رخدادهای ناهمسازی را خیلی کم افشا می‌کرد. او که به شرط ناشناس‌ماندن در این نشست حاضر شده بود، گفت چارچوب جدید طوری طراحی شده که وقتی اوپن‌ای‌آی متوجه رفتار غیرمنتظره مدل‌هایش می‌شود، بتواند سریع‌تر مردم را مطلع کند — حتی پیش از آنکه بتواند آن رفتار را به‌طور کامل بررسی، توضیح یا مهار کند.

این چارچوب شیوه‌هایی را مشخص می‌کند که کارکنان اوپن‌ای‌آی با آن می‌توانند رخدادهای ناهمسازی را به رهبران ارشد ایمنی و همسوسازی شرکت گزارش دهند؛ کسانی که پس از آن تصمیم می‌گیرند آیا بررسی بیشتری لازم است یا نه. اوپن‌ای‌آی می‌گوید قصد دارد معیارهای افشای عینی‌تری را با همکاری سایر توسعه‌دهندگان هوش مصنوعی، پژوهشگران بیرونی، نهادهای استاندارد صنعتی و رگولاتورها تدوین کند. شرکت اعلام کرده روی سازوکارهای پیشنهادی برای گزارش‌دادن رخدادهای ایمنی، امنیتی و ناهمسازی به دولت فدرال آمریکا فعالانه کار می‌کند.

اوپن‌ای‌آی در یک پست وبلاگی نوشت: «در حال حاضر هیچ چارچوب صنعتی گسترده‌ای با استانداردهای صریح برای اینکه توسعه‌دهندگان هوش مصنوعی چگونه باید نمونه‌های ناهمسازی مدل‌هایشان را افشا کنند وجود ندارد. امیدواریم چارچوبی که امروز معرفی می‌کنیم اولین گام به‌سوی ساختن چنین استانداردهایی باشد: مشخص‌کردن اینکه توسعه‌دهندگان کدام موارد ناهمسازی را باید افشا کنند و گزارش‌هایشان چه چیزی باید دربرداشته باشد.»

اوپن‌ای‌آی این چارچوب را در نقطه‌ای حساس برای صنعت هوش مصنوعی منتشر می‌کند. آخر هفته گذشته سم آلتمن، مدیرعامل اوپن‌ای‌آی، از پیشنهاد داریو آمودی، مدیرعامل آنتروپیک، برای هماهنگی صنعت فناوری در جهت کندکردن توسعه هوش مصنوعی حمایت کرد. این فراخوان چند روز پس از آن مطرح شد که جیکوب کاکسون، پژوهشگر هوش مصنوعی، از آنتروپیک استعفا داد و بعد با هشدار به عموم درباره اینکه مسابقه آزمایشگاه‌های پیشرو برای ساخت هوش مصنوعی پیشرفته‌تر امنیت بشریت را به خطر می‌اندازد، وایرال شد. این درخواست‌ها برای کاهش سرعت هوش مصنوعی با مقاومت دولت دونالد ترامپ روبه‌رو شده است؛ دولتی که استدلال می‌کند صنعت نیازی به قوانین یا مقررات تازه برای ایمنی فناوری‌اش ندارد.

دو مورد از نمونه‌های ناهمسازی که اوپن‌ای‌آی روز چهارشنبه منتشر کرد مربوط به مدل‌های داخلی و منتشرنشده این شرکت است؛ مدل‌هایی که به گفته اوپن‌ای‌آی بدون اینکه به آن‌ها دستور داده شده باشد، فایل‌هایی را روی اینترنت آپلود کرده‌اند.

یکی از این رخدادها در اکتبر ۲۰۲۵ اتفاق افتاد؛ زمانی که اوپن‌ای‌آی توانایی یک مدل را در استناد به داده‌های عمومی موجود در پاسخ‌هایش آزمایش می‌کرد. اما وقتی مدل نتوانست اطلاعات مورد نیازش را پیدا کند، یک فایل را روی یک سرویس موقت میزبانی فایل آپلود کرد و سپس تلاش کرد در پاسخش به همان فایل استناد کند. به گفته شرکت، این ظاهراً تلاشی برای دورزدن یک سیستم نمره‌دهی خودکار بوده است که برای سنجش مهارت مدل در آن بنچمارک به کار می‌رفت.

در نمونه‌ای دیگر از آوریل امسال، گروهی از ایجنت‌ها مأمور شده بودند با استفاده از فایل‌های محلی، به‌صورت مشترک یک «کارپوشه» را تکمیل کنند. وقتی ایجنت‌ها برای اشتراک فایل با یکدیگر به مشکل خوردند، یکی از آن‌ها فایل‌ها را روی اینترنت عمومی آپلود کرد و لینکش را با بقیه ایجنت‌ها به اشتراک گذاشت.

در رخداد دیگری که به گفته اوپن‌ای‌آی ماه گذشته کشف شد، یک نسخه منتشرنشده از مدل GPT-6 Astra ظاهراً «دستورهایی شبیه به جیلبریک» به خودش داده است. در چند سناریو، مدل عملاً خودش را ترغیب کرده که دستورهای توسعه‌دهنده را نادیده بگیرد، شخصیت تازه‌ای به خود بگیرد یا مدت زمان پاسخ‌های مدل را محدود کند. این تلاش‌های جیلبریک‌مانند به‌ندرت رخ داده و درجات متفاوتی از موفقیت داشته‌اند، اما به گفته اوپن‌ای‌آی این رفتار نگرانی‌هایی در درون شرکت برانگیخته است. در رانِ آموزشی نسخه‌ای از Astra که به‌صورت عمومی منتشر شد، شرکت هیچ موردی از تلاش مدل برای جیلبریک‌کردن خودش مشاهده نکرده است.

اوپن‌ای‌آی همچنین جزئیات بیشتری درباره تخته‌پیامی که ایجنت‌هایش در یک پکیج‌منیجر به نام Artifactory ساخته بودند منتشر کرد. این رخداد در ماه مه امسال کشف شد، اما به گفته اوپن‌ای‌آی ایجنت‌هایش با سازوکاری مشابه، ماه‌ها بعد هک Hugging Face را هماهنگ کردند. در این رخداد، شرکت می‌گوید ایجنت‌هایش برای تبادل پیام از هیچ آسیب‌پذیری سوءاستفاده نکردند. اوپن‌ای‌آی می‌گوید حالا از پایشگرهای همسوسازی، ارزیابی‌ها و تلاش‌های تیم سرخ برای اطمینان از این استفاده می‌کند که ایجنت‌هایش پنهانی با یکدیگر ارتباط برقرار نکنند.

متخصصان امنیت سایبری پیش‌تر به وایرد گفته بودند هک Hugging Face به خطای انسانی برمی‌گردد و شیوه‌های امنیتی مدرن می‌توانست از این رخداد جلوگیری کند. اما چن می‌گوید اوپن‌ای‌آی دنبال رویکردی همه‌جانبه به ایمنی هوش مصنوعی است که توانایی‌های روبه‌رشد مدل‌ها را در نظر بگیرد و به یک محیط امن وابسته نباشد.

او می‌گوید: «می‌خواهیم مطمئن شویم مدل‌ها مستقل از اینکه در چه محیطی مستقر می‌شوند، همسو باقی می‌مانند. وقتی افراد انگشت اتهام را به سمت دیگری نشانه می‌گیرند و می‌گویند این یک مسئله امنیتی است نه مسئله همسوسازی، به نظر من این استدلال چندان منطقی نیست؛ چون شما مدل را می‌خواهید همیشه خوش‌رفتار باشد.»

منبع: wired.com ←
# مدل‌ها و چیپ‌ها
🔗 اخبار مرتبط

بخوانید