گوگل حالا ریاضیِ رتبه‌بندی بدون ایندکس را در دست دارد؛ سرنوشت صفحه نتایج چه می‌شود؟
دیجیتال مارکتینگ جهان سئو و جستجو

گوگل حالا ریاضیِ رتبه‌بندی بدون ایندکس را در دست دارد؛ سرنوشت صفحه نتایج چه می‌شود؟

۱۷ مهر ۱۴۰۵ ⏱ ۶ دقیقه مطالعه 👁 ۰ بازدید ✍️ تحریریه رشدینو
✈️ اشتراک در تلگرام 💬 واتساپ 𝕏 توییتر
📌 نکات کلیدی و خلاصه خبر پاسخ سریع در یک نگاه

مقاله‌ای از پژوهشگران گوگل اثبات می‌کند یک مدل زبانی واحد می‌تواند بی‌نیاز از ایندکس جداگانه، اسناد را رتبه‌بندی کند؛ پیامدی که آینده صفحه نتایج و سئو را دگرگون می‌کند.

پژوهشگران گوگل حالا روی کاغذ اثبات کرده‌اند که یک مدل زبانی واحد می‌تواند تعداد نامحدودی از اسناد را بدون ایندکس جداگانه رتبه‌بندی کند. پیامد عملی آن این است که فهرست رتبه‌بندی‌شده از چیزی که می‌بینید به چیزی تبدیل می‌شود که مدل در مسیر رسیدن به یک پاسخ محاسبه می‌کند. این‌جانبه ماجرا بیشتر از آزمایش‌های فروتنانه‌ای که در مقاله انجام شده برای فعالان صنعت اهمیت دارد.

راجر مونتی پیش‌تر این مقاله را در سرچ انجین ژورنال پوشش داد و توضیح مکانیک آن را ارائه کرد: اینکه خط لوله دومرحله‌ای امروزی چگونه یک دو‌انکودر سریع و ارزان برای بازیابی را با یک کراس‌انکودر کندتر و دقیق‌تر برای رتبه‌بندی مجدد جفت می‌کند، و تیم دیپ‌مایند چگونه پیشنهاد می‌کند هر دو را در یک مدل مولّد ادغام کند. اما نکته مهم‌تر آینده‌نگری به سمت پیامدهای این معماری برای صنعت، برای کار و برای کسی است که پرسش را تایپ می‌کند.

یک افشا اول: نویسنده این تحلیل مؤسس «سیتی‌شنی کیو»، یک پلتفرم اندازه‌گیری داده و دیده‌شدن هوش مصنوعی است؛ پس وقتی می‌گوید اندازه‌گیری تحت این مدل تغییر می‌کند، خودش هم ذی‌نفع این تغییر است. آنچه در ادامه می‌آید گمانه‌زنی آگاهانه است. مقاله یک ظرفیت نظری را اثبات و یک روش آموزش را روی دو مجموعه‌داده کوچک نشان می‌دهد. هیچ‌کس هنوز ایندکس وب را با آن جایگزین نکرده است. اما گوگل پنج سال پژوهش را در یک جهت منتشر نمی‌کند مگر آنکه آن جهت جدی باشد.

این مقاله جمله گوگل در سال ۲۰۲۱ را تمام می‌کند

در سال ۲۰۲۱، چهار پژوهشگر گوگل مقاله‌ای با عنوان «بازاندیشی در جست‌وجو: متخصص ساختن از آماتورها» منتشر کردند که استدلال می‌کرد یک سیستم جست‌وجو باید مستقیماً از پیکره‌ای پاسخ دهد که می‌تواند به آن ارجاع بدهد، نه اینکه فهرستی از منابع را تحویل کاربر دهد. این مقاله سلب مسئولیت داشت که یک پیشنهاد پژوهشی است نه نقشه راه محصول، و آن سلب مسئولیت همچنان بر همه چیزهای پس از آن حاکم است. در سال ۲۰۲۲ تقریباً همان گروه «ایندکس جست‌وجوی مشتق‌پذیر» را منتشر کردند که نشان داد یک ترنسفورمر واحد می‌تواند یک پرس‌وجو را مستقیماً به شناسه‌های اسناد نقشه‌برداری کند، در حالی که کل پیکره در پارامترهای مدل کدگذاری شده است.

مقاله ژانویه ۲۰۲۶ نظریه را فراهم می‌کند: اثبات می‌کند که ابعاد تعبیه یک دو‌انکودر برای بیان هر رتبه‌بندی ممکن باید متناسب با تعداد اسناد به‌صورت خطی رشد کند، در حالی که یک مدل خودرگرسیو با بُعد پنهان ثابت می‌تواند تعداد دلخواهی از اسناد را رتبه‌بندی کند. سپس یک تابع خطای آموزشی با نام SToICaL معرفی می‌کند که مدل را تشویق می‌کند به کل فهرست رتبه‌بندی‌شده اهمیت بدهد، نه فقط نتیجه اول. پس قوس ماجرا این است: پیشنهاد، نمونه اولیه، اثبات. گوگل ایده تازه‌ای مطرح نمی‌کند؛ شکاف نظری یک شرط‌بندی را می‌بندد که پنج سال پیش علناً انجام داده بود.

اما آزمایش‌ها را صادقانه بخوانیم: تیم مدل Mistral-7B را تنظیم دقیق کرد، نه یک مدل پیشرو. رتبه‌بندی درون‌متنی انجام شد، یعنی شناسه‌های اسناد نامزد در پرامپت قرار می‌گرفتند و مدل میان آن‌ها انتخاب می‌کرد؛ این رتبه‌بندی مجدد است نه بازیابی از پیکره‌ای باز. «وردنت» حدود ۸۲ هزار مفهوم اسمی دارد. ارزیابی خرید روی ۳۱۰ نمونه اجرا شد. یک پیکربندی حتی در قرار دادن بهترین نتیجه در جای اول بدتر شد، هرچند بقیه فهرست را بهتر کرد. این یک بنیان است نه یک استقرار.

اسناد به کد تبدیل می‌شوند و کد است که رتبه می‌گیرد

در این معماری، یک سند یک نشانی وب نیست؛ یک «شناسه سند» (docID) است؛ دنباله‌ای کوتاه از توکن‌ها که مدل یکی‌یکی تولید می‌کند، همان‌طور که کلمات را تولید می‌کند. در آزمایش خرید، شناسه هر محصول از تعبیه عنوانش استخراج و به سه عدد فشرده شد، بنابراین شناسه معنادار است و محصولات مشابه رقم‌های نخست مشترک دارند. مدل با تولید محتمل‌ترین شناسه و سپس محتمل‌ترین شناسه بعدی، از طریق جست‌وجوی پرتویی، رتبه‌بندی می‌کند. جست‌وجویی وجود ندارد؛ نشانی تولید می‌شود، نه بازیابی.

سه پیامد برای کسی که کارش انتخاب شدن محتواست: نخست، «متمایزبودن» به هدف بهینه‌سازی تبدیل می‌شود؛ اگر صفحه در فضای تعبیه از همسایه‌هایش جدا نشود، نمی‌تواند شناسه پایدار و متمایز داشته باشد، و دو صفحه محصول تقریباً یکسان دیگر بر سر جایگاه مجاور رقابت نمی‌کنند بلکه بر سر یک نشانی رقابت می‌کنند و یکی کاملاً می‌بازد. دوم، «تابع رتبه‌بندی همان مجموعه آموزش است»؛ SToICaL روی سه‌گانه‌های پرس‌وجو، شناسه سند و رتبه واقعی آن سند در یک فهرست رتبه‌دار آموزش می‌بیند. هرچه آن فهرست‌ها را تولید کرده — لاگ کلیک، قضاوت ارزیاب یا سیگنال تعامل — همان الگوریتم می‌شود؛ هیچ لایه جداگانه‌ای از عوامل رتبه‌بندی برای مهندسی معکوس وجود ندارد. سوم، «تازگی به یک مسئله آموزشی تبدیل می‌شود»؛ در ایندکس کلاسیک یک صفحه جدید خزش و درج می‌شود، اما در ایندکس مولد پارامتریک باید یاد گرفته شود، و کار بعدی خود گوگل (DSI++) دریافت که ایندکس‌کردن مداوم اسناد جدید باعث فراموشی قابل توجه اسناد پیش‌تر ایندکس‌شده می‌شود.

پرتوی همان کل جهان است

جست‌وجوی پرتویی راهی است که مدل مولد فهرست کوتاه تولید می‌کند: در هر گام فقط تعداد ثابتی از محتمل‌ترین دنباله‌های ناقص را نگه می‌دارد، آن‌ها را بسط می‌دهد و بقیه را دور می‌ریزد؛ پس فهرست نهایی هرگز نمی‌تواند بلندتر از تعداد نگه‌داشته‌شده باشد. یک پرتو با عرض ده، ده نتیجه می‌دهد. جایگاه یازدهم یک نتیجه بد نیست؛ هرگز تولید نشده است. صفحه دو دیگر یک تصمیم طراحی نیست و چیزی می‌شود که وجود ندارد. ردیابی رتبه زیر پرتو هیچ‌چیز را اندازه نمی‌گیرد، چون چیزی زیر پرتو برای اندازه‌گیری نیست. دیده‌شدن دودویی می‌شود: در مجموعه تولیدشده هست یا از آن غایب است. و از بیرون راهی برای تمایز میان «بد رتبه‌بندی شده» و «هرگز تولید نشده» وجود ندارد. پرسش فعال صنعت از «ما در چه جایگاهی هستیم» به «آیا در مجموعه تولیدشده هستیم، با چه ثباتی و برای چه شکل‌هایی از پرس‌وجو» تغییر می‌کند.

طنز واقعی مقاله این است که سهم اصلی‌اش رتبه‌بندی بهتر در جایگاه‌های پایین‌تر از یک است. روی وردنت، آموزش رتبه‌آگاه، بازیابی در جایگاه‌های دو تا پنج را از حدود پنجاه به نودوچند درصد رساند؛ یعنی بهترکردن ترتیب نتایج دوم تا پنجم درست همان لحظه‌ای می‌رسد که سطح نمایش، تعداد کمتری از آن‌ها را نشان می‌دهد. بهبود، درست روی بخشی از فهرست فرود می‌آید که مصرف‌کننده کم‌ترین احتمال دیدنش را دارد.

اثر آن بر کلیک‌ها و پول

درآمد جست‌وجو و سایر خدمات گوگل در سه‌ماهه دوم ۶۳.۲۷ میلیارد دلار و با رشد ۱۷ درصد بود، پس از رشد ۱۹ درصدی فصل پیش. حراج تبلیغات یک سیستم جداست و این مقاله به آن دست نمی‌زند. جایی که مقاله بر درآمد اثر دارد، هزینه است: خط لوله دومرحله‌ای وجود دارد چون اجرای کراس‌انکودرها روی کل پیکره گران است. رتبه‌بندی خودرگرسیو، ایندکس جداگانه نزدیک‌ترین همسایه را حذف می‌کند و هر سند را به‌صورت فردی نمره نمی‌دهد؛ یعنی کاهش هزینه ساختاری برای نتایج مولد. هزینه همواره قید خاموشی بر گسترش پاسخ‌های هوش مصنوعی گوگل به‌عنوان تجربه پیش‌فرض بوده است. کافی است این قید برداشته شود تا آخرین دلیل ساختاری برای نگه‌داشتن «ده لینک آبی» — همان‌جایی که موجودی تبلیغات در آن زندگی می‌کند — ضعیف‌تر شود؛ نه به این معنا که تبلیغات می‌میرد، بلکه چون سطح میزبان آن تغییر می‌کند و تبلیغات هم با آن جابه‌جا می‌شوند.

آنچه مصرف‌کننده می‌گیرد

گزینه‌های کمتر، مرتب‌تر. حل‌وفصل سریع‌تر. دنباله‌ای نامرئی. و هیچ نشانه‌ای که «کسی دیگر مرتبط نبود» را از «کسی دیگر تولید نشد» تشخیص دهد، چون مصرف‌کننده هرگز نتایج تولیدنشده را نمی‌بیند و دلیلی برای فکر کردن به آن‌ها ندارد. از همه چیز این مقاله، این بخشی است که کم‌ترین راحتی را برای نویسنده دارد و به گمانش محتمل‌ترین بخش است.

❓ پرسش‌های متداول درباره این خبر

موضوع اصلی گزارش «گوگل حالا ریاضیِ رتبه‌بندی بدون ایندکس را در دست دارد؛ سرنوشت صفحه نتایج چه می‌شود؟» چیست؟

مقاله‌ای از پژوهشگران گوگل اثبات می‌کند یک مدل زبانی واحد می‌تواند بی‌نیاز از ایندکس جداگانه، اسناد را رتبه‌بندی کند؛ پیامدی که آینده صفحه نتایج و سئو را دگرگون می‌کند.

این رویداد چه اهمیتی برای فعالان کسب‌وکار و فناوری دارد؟

بدون ایندکس جداگانه رتبه‌بندی کند. پیامد عملی آن این است که فهرست رتبه‌بندی‌شده از چیزی که می‌بینید به چیزی تبدیل می‌شود که مدل در مسیر رسیدن به یک پاسخ محاسبه می‌کند. این‌جانبه ماجرا بیشتر از آزمایش‌های فروتنانه‌ای که

# سئو و جستجو
🔗 اخبار مرتبط

بخوانید