کلادفلر تنظیم تازهای به نام «Disallow AI Training» یا «ممنوعیت آموزش هوش مصنوعی» معرفی کرده و میگوید سایتهایی که از قبل آموزش هوش مصنوعی را مسدود کرده بودند، بهطور خودکار به این تنظیم منتقل میشوند. این تنظیم یک ترجیح «بدون آموزش» را در فایل robots.txt اضافه میکند، در حالی که همچنان به گوگلبات، اپلبات و بینگبات اجازه میدهد برای مقاصد جستوجو سایت را بخزند.
این تصمیم با برنامهای که کلادفلر در ماه ژوئیه اعلام کرده بود فرق دارد. در آن زمان این شرکت توضیح داده بود که از پانزدهم سپتامبر، سایتهایی که آموزش هوش مصنوعی را مسدود میکنند، همان سه خزنده را هم مسدود خواهند کرد؛ چرا که این خزندهها هم برای جستوجو و هم برای آموزش استفاده میشوند. حالا انتخاب گزینه «Block» بهطور کامل جلوی گوگلبات، اپلبات و بینگبات را — حتی برای جستوجو — میگیرد، اما گزینه تازه مسیر دیگری پیش پای ناشران میگذارد.
Disallow AI Training قابلیت جدیدی در کنترل Training کلادفلر است که یکی از سه کنترل این شرکت در کنار Search و Agent محسوب میشود. کلادفلر اولین بار در ماه اوت آن را توصیف کرده بود. وقتی این تنظیم فعال شود، خزندههای چندکاره که هم برای جستوجو و هم برای آموزش سایت را میخزند، تنها در صورتی برای جستوجو مجاز میمانند که شرکت آنها را «Accountable» یا «پاسخگو» علامت زده باشد. سایر خزندههای آموزش، مسدود خواهند شد.
گزینههای Block و Block on pages with ads هم حالا روی خزندههای چندکاره اعمال میشوند. کلادفلر میگوید پیش از این این خزندهها را از هر دو تنظیم بیرون گذاشته بود، چون مسدودکردن آنها میتوانست به دیدهشدن سایت در جستوجو آسیب بزند.
به گفته این شرکت بیشتر مشتریها نیازی به تغییر چیزی ندارند. انتخابهای فعلی Training در حالت Block یا Block on pages with ads بهطور خودکار به Disallow AI Training منتقل میشوند. سایتهایی که از هر یک از گزینههای مسدودسازی در کلید قدیمی «Block AI Bots» استفاده کردهاند، ترکیب تازهای میگیرند: مجاز برای جستوجو، ممنوع برای آموزش و مسدود برای Agent در صفحات دارای آگهی. دو قابلیت Block AI Bots و Managed Robots.txt هم قرار است بازنشسته شوند. برای اینکه خزندههای چندکاره کاملاً از سایت بیرون بمانند، به گفته کلادفلر حالا باید گزینه Block را انتخاب کرد. دامنههای تازهای که با آگهی کسب درآمد میکنند هم Disallow AI Training را بهعنوان پیشفرض Training دریافت میکنند.
پرسش کلیدی این است که کدام خزندهها دسترسی جستوجویی خود را نگه میدارند. خزندههای چندکاره زیر این تنظیم فقط در صورتی دسترسی جستوجو را حفظ میکنند که کلادفلر آنها را «پاسخگو» بداند؛ عنوانی که این شرکت پس از گفتوگو با اپراتورهای خزنده از ژوئیه آغاز کرده است. برای دریافت این عنوان، اپراتور باید چهار شرط را برآورده کند یا متعهد به برآوردهکردنشان شود: راهی برای انصراف از آموزش هوش مصنوعی از طریق robots.txt یا استانداردی مشابه؛ راهی برای انصراف از خلاصههای هوش مصنوعی که همین حالا توسط اپراتور و از سال آینده از طریق کلادفلر قابل تنظیم است؛ شفافیت سطح نشانی درباره اینکه کدام صفحات برای آموزش در دسترس بودهاند و متریکهایی درباره نحوه حضور محتوا در جستوجو؛ و تضمین اینکه انصراف از آموزش روی نتایج جستوجوی سنتی اثر نمیگذارد.
کلادفلر میگوید اپل، گوگل و مایکروسافت این شرایط را برآورده میکنند؛ هرکدام با قابلیتهایی که همین حالا موجود است بههمراه تعهدهای زماندار برای بقیه موارد. خزندههای مرتبط آمازون، آنتروپیک، متا و اوپنایآی هم در فهرست «پاسخگو» قرار گرفتهاند، چون این شرکتها خزندههای جستوجو و آموزش خود را جداگانه اجرا میکنند. با این حال خزندههای آموزشی آنها زیر تنظیم تازه همچنان مسدود میمانند.
در گوگل، Disallow AI Training از طریق یک قاعده Disallow برای توکن Google-Extended عمل میکند؛ همان توکنی که گوگل برای انصراف محتوا از آموزش مدلهای جمینای در robots.txt ارائه کرده است. مستندات گوگل میگوید Google-Extended روی حضور سایت در جستوجوی گوگل یا رتبهاش اثر ندارد. تنظیم جداگانهای در سرچ کنسول هم کنترل میکند که سایت در خلاصههای هوش مصنوعی، حالت AI و بخشهای مولد دیسکاور ظاهر شود یا نه؛ صفحه راهنمای گوگل تأکید میکند آن تنظیم به آموزش هوش مصنوعی ارتباطی ندارد.
در اپل، این تنظیم از طریق قاعده Disallow برای Applebot-Extended اعمال میشود. مستندات اپل میگوید Applebot-Extended صفحات را نمیخزد و در رتبهبندی جستوجو لحاظ نمیشود. برای بیرون نگهداشتن محتوا از پاسخهای تولیدشده هوش مصنوعی به پرسشهای عمومی در سیری و جستوجو، باید از متاتگ nosnippet استفاده کرد.
انتخاب Disallow AI Training فعلاً هیچ ترجیح «بدون آموزش» را از طریق robots.txt به بینگ نمیفرستد، چون مایکروسافت هنوز باید پشتیبانی از آن را اضافه کند و این قابلیت به گفته کلادفلر در دست ساخت است. مسدودسازی پیشین Training در کلادفلر هم روی بینگبات اثری نداشت. روش فعلی انصراف از آموزش در بینگ، متاتگ NOARCHIVE است. طبق مستندات بینگ، محتوایی که با NOARCHIVE علامت خورده برای آموزش مدلهای مولد مایکروسافت استفاده نمیشود و در چت و کوپایلوت هم لینک نمیشود.
چرا این تغییر مهم است؟ انتخاب گزینه Block بهجای Disallow AI Training در کلادفلر نهفقط خزندههای آموزش هوش مصنوعی، بلکه گوگل، اپل و بینگ را هم از خزیدن سایت بازمیدارد و مستقیم به دیدهشدن سایت در جستوجو ضربه میزند. Disallow AI Training دقیقاً به همان انصرافهای آموزشی گوگل و اپل نگاشت میشود و تصمیم نمیگیرد که صفحات در خلاصههای هوش مصنوعی و حالت AI ظاهر شوند یا نه، چون گوگل این را از طریق سرچ کنسول مدیریت میکند. در بینگ هم انصراف از آموزش همچنان با تگ NOARCHIVE مشخص میشود؛ یعنی لینکهای کوپایلوت هم از نتیجه بیرون میمانند.
کلادفلر درباره آینده هم خبر میدهد: گوگل قصد دارد در هفتههای آینده ابزارهای شفافیت سطح نشانی برای Google-Extended را عرضه کند و اپل روی ابزار مشابه خود برای سال آینده کار میکند. پشتیبانی مایکروسافت از ترجیح «بدون آموزش» در robots.txt هم برای ابتدای ۲۰۲۷ هدفگذاری شده است. تمرکز بعدی خود کلادفلر خلاصههای هوش مصنوعی است؛ این شرکت میگوید هدفش این است که تا ابتدای سال آینده بتوان با یک تنظیم واحد در کلادفلر مقدار محتوایی را که در خلاصهها استفاده میشود کنترل کرد، بهجای تنظیم جداگانه برای هر اپراتور.