اوپنایآی روز سهشنبه اعلام کرد که مدل هوش مصنوعی آتیاش، استرا (Astra)، نخستین مدلی است که به آستانهای که این شرکت آن را توانمندیهای سایبری «بحرانی» مینامد رسیده است. این شرکت میگوید قصد دارد نسخهای از استرا را «بهزودی» برای عموم منتشر کند، اما توانمندیهای سایبری پیشرفته این مدل را در زمان عرضه فقط در اختیار شرکای منتخب برنامه دسترسی زودهنگام «Daybreak Blue» قرار خواهد داد.
در نشستی خبری با خبرنگاران، مدیران ایمنی و امنیت اوپنایآی گفتند این شرکت به این نتیجه رسیده است که استرا به توانمندیهای سایبری بحرانی تعریفشده در «چارچوب آمادگی» (preparedness framework) خود رسیده است؛ چارچوبی که آستانهها و پروتکلهای مواجهه با سطوح جدید ریسک مدلهای هوش مصنوعی را تعیین میکند. طبق تعریف این شرکت، یک مدل هوش مصنوعی زمانی به آستانه سایبری بحرانی رسیده است که بتواند بهطور مستقل آسیبپذیریهای ناشناخته را در نرمافزارهای واقعی پیدا کند و از آنها بهرهبرداری کند. مدیران اوپنایآی تأکید کردند که این شرکت رویه تعیینشده برای چنین وضعیتی را دنبال کرده است: توقف توسعه تا زمانی که محافظتها و اقدامات امنیتی مناسب پیادهسازی شوند.
اوپنایآی پیشتر اعلام کرده بود برخی بارهای کاری آموزش مرتبط با توسعه استرا و یک مدل آینده را برای چند هفته متوقف کرده است. مدیران اجرایی میگویند پس از استقرار کنترلهای ایمنی و امنیتی اضافی، کار روی استرا و آن مدل آینده از سر گرفته شده است. به گفته اوپنایآی، توقف چند هفتهای «مثمر» بوده و این شرکت حالا مطمئن است که میتواند استرا را بهشکلی امن و گسترده عرضه کند.
این اعلام در حالی منتشر میشود که سیلیکونولی با توانمندیهای سایبری پیشرفته مدلهای پیشروی هوش مصنوعی دستوپنجه نرم میکند و تلاش دارد به کاربران، قانونگذاران و سایر شرکتها اطمینان دهد که میتواند این توانمندیها را تحت کنترل نگه دارد. در ماه ژوئیه، اوپنایآی حادثهای را فاش کرد که در آن عاملهای (agents) اجراشونده روی دو مدل از مدلهای این شرکت، آسیبپذیریهایی را در محیط آزمایشی که قرار بود جداسازیشده باشد بهرهبرداری کردند، به اینترنت دسترسی پیدا کردند و پلتفرم متنباز هوش مصنوعی Hugging Face را هک کردند. (اوپنایآی تأکید کرده است که استرا در این حادثه دخیل نبوده است.)
دیگر شرکتهای هوش مصنوعی مانند آنتروپیک و متا نیز در هفتههای اخیر حوادث مشابهی را فاش کردهاند. آنتروپیک روز دوشنبه هم اعلام کرد برخی بارهای کاری آموزش هوش مصنوعی خود را در حالی متوقف کرده است که رویههای ایمنی و امنیتیاش را سختگیرانهتر میکند.
اوپنایآی میگوید برای محدود کردن دسترسی کاربران عادی به توانمندیهای سایبری پیشرفته استرا رویکردی چندلایه پیاده کرده است که شامل یک «نظارتگر ناهمراستایی» (misalignment monitor) جدید نیز میشود. اگر کسی مثلاً از استرا بخواهد در یک سیستم نرمافزاری واقعی یک اکسپلویت پیدا کند، مدل قرار است از پاسخ دادن خودداری کند. اوپنایآی همچنین میگوید استرا را در برابر تلاشهای فرار از محدودیت (jailbreak) مقاومتر کرده است و در آزمونها، این مدل با نرخ بهمراتب بالاتری نسبت به مدلهای قبلی از پاسخ به درخواستهای ناامن خودداری کرده است.
با این حال، اوپنایآی در یک پست وبلاگی خاطرنشان کرده است که نظارتگر ناهمراستی ممکن است «گاهی فعالیتهای مشروع را بهعنوان سوءاستفاده سایبری بالقوه یا رفتار غیرمجاز علامتگذاری کند و باعث شود بهطور ناخواسته کند، متوقف یا معلق شود». این شرکت میگوید در برخی موارد ممکن است این گاردریل حتی وقتی کاربر مشغول فعالیتهایی است که به امنیت سایبری مرتبط به نظر نمیرسند فعال شود. در چنین شرایطی، کاربران ChatGPT و Codex ممکن است پیش از ادامه کار، برای بازبینی اقدام مدل فراخوانده شوند.
شرکای برنامه Daybreak اوپنایآی — که شامل ارائهدهندگان زیرساخت دیجیتال مانند Cisco، Cloudflare و Palo Alto Networks میشود — به نسخهای با محدودیتهای کمتر و توانمندیهای سایبری قویتر از استرا دسترسی زودهنگام خواهند داشت. هدف این برنامه اطمینان از این است که این شرکتها بتوانند پیش از عرضه گسترده مدلهای مشابه، از مدلهای پیشرفته هوش مصنوعی مانند استرا برای تقویت دفاع خود استفاده کنند. مدیران اوپنایآی همچنین گفتند این شرکت از نزدیک با شرکای دولتی همکاری کرده تا آنها از توانمندیهای سایبری استرا آگاه باشند و بتوانند به آن دسترسی پیدا کنند.
استرا نهتنها قادر به یافتن آسیبپذیریهای نرمافزاری جدید و توسعه روشهای بهرهبرداری از آنها برای هک است، بلکه میتواند چند اکسپلویت را «زنجیره» کند؛ تکنیکی که برای نفوذ هرچه عمیقتر به سیستم هدف به کار میرود و دسترسیهایی را ممکن میکند که با فقط یک آسیبپذیری به دست نمیآیند.
طبق آمار اوپنایآی، استرا در معیارهای امنیت سایبری مانند ExploitBench از مدلهای پیشروی صنعت مثل GPT-5.6 Sol و مدل Mythos آنتروپیک بهتر عمل میکند و در ExploitBench امتیاز ۱۰۰ درصد کسب کرده است. با این حال، این توانمندیها اساساً همراستا با رشد تواناییهای هک مدلهای هوش مصنوعی است که اوپنایآی و آنتروپیک ماههاست پیشبینی میکنند. بهعنوان مثال، آنتروپیک در آوریل تأکید کرده بود که Mythos Preview قادر است بهطور خودمختار زنجیرههای اکسپلویت را توسعه دهد.
در حالی که صنایع هوش مصنوعی و امنیت سایبری برای سازگاری با این وضعیت تلاش میکنند، بسیاری از کارشناسان امنیت سایبری تأکید کردهاند که دفاعهای کلیدی امنیت دیجیتال و بهترین شیوههای دیرینه استفادهکننده از آنها همچنان پایدار هستند. با این حال، هوش مصنوعی سازمانها و سیستمهایی را که این محافظتها را بهطور کامل پیاده نکردهاند در معرض ریسکی فوریتر و جدیتر قرار میدهد.