دنیا حالا با کلیشههای همیشگی متن تولیدشده با ماشین آشناست: استفاده بیش از حد از کلمه delve، چیدن پشت سر هم خط تیره بلند، و ساختار شاد و بیپایان «این X نیست، بلکه Y است».
آنتروپیک در پایان هفته گذشته بهروزرسانیای منتشر کرد و گفت تغییر میدهد که مدل هوش مصنوعیاش Claude نثر تولید میکند. این برای انطباق با مقررات اتحادیه اروپاست که از دسامبر برای تمام متنهای تولیدشده با هوش مصنوعی واترمارک اجباری میگذارد.
آنتروپیک گفت این تغییرات در سطح جزئی و تصادفیای اعمال میشود که مدلهایش در آن متن تولید میکنند و برای خواننده عادی قابل تشخیص نخواهد بود.
اما دستکم یک مفسر نظر دیگری دارد. جان گروبر، وبلاگنویس کهنهکار فناوری، نوشت: «کل این تلاش، تحریف شنیعی از معنای نوشتن است.» او استدلال کرد که واترمارک Claude را محدود میکند و وادارش میکند در مجموع، انتخابهای کلمهای بدتر و کمدقتتری بکند. شاید متن مدل را نادقیقتر نکند، اما گفت این محدودیتها کیفیتش را پایین میآورد.
در انتخابهای کوچکی که مدل هوش مصنوعی هنگام ساخت یک جمله میکند، عنصر تصادفی وجود دارد: مثلاً اینکه روز را «ابری» بنامد یا «مهآلود»، یا از جریان آب با واژه stream یاد کند یا brook.
آنتروپیک گفت واترمارک جدیدش این انتخابهای تصادفی را تغییر میدهد و الگویی بهجا میگذارد که خود آنتروپیک و کسانی که کلید رمزگشایی آن را دارند میتوانند تشخیص دهند.
استیون مرداک، استاد علوم کامپیوتر دانشگاه کالج لندن (UCL)، گفت این تغییر «به احتمال زیاد هیچ تأثیر قابل توجهی نخواهد داشت».
شکایت گروبر به نظر حول این میچرخد که واترمارکگذاری، مدل زبانی بزرگ را در تصمیمگیری درباره کلمه بعدی جمله آزادی کمتری میدهد و شاید بهترین گزینه را انتخاب نکند.
اما مدلهای زبانی بزرگ همین حالا هم بهترین انتخابها را نمیکنند. مرداک گفت: «همین حالا هم در همه این مدلهای زبانی بزرگ تصادف وجود دارد. بخش جداییناپذیر کارکردشان است. اگر این تصادف نبود، در حلقههای تکراری گیر میافتادند و شروع میکردند به تکرار یک چیز پشت سر هم.»
به بیان دیگر، چتبات لزوماً تصمیم نمیگیرد جریان آب را stream بنامد نه brook، به این دلیل که دومی قدیمیتر و ادبیتر است. مدل این انتخابها را نمیسنجد: با شانس انتخابشان میکند.
این به تازگی جایی ثابت شد که مقالهای در یک مجله معتبر شیمی پس از آن باطل شد که معلوم شد نویسندگان به نظر از ابزار هوش مصنوعی برای پیشنویس بخشی از مقاله استفاده کردهاند. آن ابزار عبارت «کشتار جمعی یک گروه قومی» را بهجای «راهحل نهایی» پیشنهاد داده بود، در حالی که پاراگراف مورد بحث به نظر درباره یک نانوژل روی است.
درباره این بهروزرسانی، مرداک گفت: «تفاوت قابل توجهی نخواهد بود. همان مولدهای اعداد تصادفی آنجاست — فقط قبلاً کاملاً تصادفی بود و حالا دیگر کاملاً تصادفی نیست، اما همچنان از نظر آماری غیرقابل پیشبینی است.»
این مقررات که بر همه شرکتهای هوش مصنوعی فعال در اتحادیه اروپا اعمال میشود، یعنی آنها باید ظرف چند ماه این واترمارکها را پیاده کنند. این میتواند کار دانشجویان، وکلا و استادان دانشگاه را برای جا زدن متن چتبات بهعنوان نوشته خودشان سختتر کند.
اما مرداک دلیل دیگری هم برای واترمارک محتوای هوش مصنوعی دارد: از این محتوا آنقدر در وب انباشته شده که ممکن است به خود مدلها آسیب بزند. آموزش دادن هوش مصنوعی روی محتوای تولیدشده با هوش مصنوعی باعث «فروپاشی مدل» میشود و مدلها را به اشتباه انداختن در مفاهیم میکشاند.
به بیان دیگر، واترمارکگذاری فقط ابزاری ظریف و قدرتمند برای مبارزه با دیساینفورمیشن نیست — سیستمی بنیادین برای اطمینان از اینکه چتباتها دیوانه نشوند است. اگر با دقت در آن بگردید.