جان مولر، تحلیلگر و نماینده ارشد گوگل، بهتازگی با بررسی لاگهای سرور شخصی خود نکته فنی و بسیار مهمی را درباره نحوه عملکرد رباتهای هوش مصنوعی افشا کرده است. به گفته او، خزندههای آموزش مدلهای زبانی بر خلاف موتورهای جستجوی سنتی، ابزار اختصاصی برای ثبت دستی نقشه سایت ندارند و برای کشف محتوا، به نامهای پیشفرض سایتمپ و خوراک RSS متکی هستند.
ماجرای بررسی لاگهای سرور توسط جان مولر چیست؟
دنیای هوش مصنوعی و مدلهای بزرگ زبانی (LLM) با سرعتی باورنکردنی در حال رشد است. شرکتهایی مانند OpenAI، Anthropic و Perplexity برای آموزش مدلهای خود و ارائه پاسخهای بهروز به کاربران، نیازمند جمعآوری داده از سراسر وب هستند. اما این خزندهها (AI Crawlers) چگونه صفحات جدید وبسایتها را پیدا میکنند؟
جان مولر (John Mueller) با تحلیل لاگهای سرور (Server Logs) وبسایت خود متوجه رفتار جالبی از سوی این خزندهها شد. برخلاف گوگل و بینگ که ابزارهای پیشرفتهای مانند «گوگل سرچ کنسول» را برای معرفی مستقیم نقشه سایت (Sitemap) در اختیار وبمسترها قرار میدهند، اکثر خزندههای هوش مصنوعی چنین بستر مستقیمی ندارند.
طبق مشاهدات مولر، این رباتها بهطور خودکار به دنبال آدرسهای استاندارد و پیشفرض نقشه سایت و همچنین فیدهای خبری میگردند تا محتوای جدید را بازخوانی کنند.
چرا خزندههای هوش مصنوعی کنسول اختصاصی ندارند؟
موتورهای جستجوی سنتی برای رتبهبندی دقیق، بررسی جریمهها و مدیریت اندکس صفحات، نیازمند ارتباط دوطرفه با صاحبان سایتها هستند. اما هدف اصلی خزندههای هوش مصنوعی در حال حاضر، جمعآوری متون و دادههای متنی برای آموزش مدلها یا استخراج اطلاعات است. از همین رو، این شرکتها هنوز زیرساختی مشابه سرچ کنسول برای دریافت دستی لینکها طراحی نکردهاند و فرآیند کاوش (Crawling) آنها کاملاً متکی بر روندهای خودکار است.
```
تفاوت اصلی: موتورهای جستجو بستری برای ثبت دستی (Submission) دارند، اما خزندههای هوش مصنوعی متکی بر آدرسهای استاندارد و ساختاریافته هستند.
نقش کلیدی نامهای پیشفرض سایتمپ (Sitemap)
یکی از مهمترین نکات مطرحشده توسط جان مولر، اهمیت استفاده از نامها و مسیرهای استاندارد برای فایل نقشه سایت است. بسیاری از مدیران سایتها برای مسائل امنیتی یا ساختار کدهای اختصاصی، آدرس سایتمپ خود را تغییر میدهند (برای مثال: my-custom-sitemap.xml).
مولر توضیح میدهد که خزندههای هوش مصنوعی بهطور معمول آدرسهای استاندارد زیر را درخواست میکنند:
* example.com/sitemap.xmlexample.com/sitemap_index.xml
*
اگر وبسایت شما از نامهای غیرمعمول استفاده کند و این آدرسها در فایل robots.txt نیز بهدرستی معرفی نشده باشند، رباتهای هوش مصنوعی احتمالاً نمیتوانند نقشه سایت شما را پیدا کنند. این موضوع باعث میشود محتوای جدید شما در بازه زمانی طولانیتری توسط هوش مصنوعی کشف شود یا حتی کلاً از دید آنها پنهان بماند.
تجدید حیات خوراک RSS در عصر هوش مصنوعی
نکته غافلگیرکننده دیگری که در لاگهای سرور جان مولر مشاهده شد، توجه ویژه خزندههای هوش مصنوعی به خوراک RSS یا Atom بود. در حالی که طی سالهای اخیر بسیاری از کاربران سنتی استفاده از RSS خوانها را کنار گذاشتهاند، اما این تکنولوژی قدیمی به ابزاری محبوب برای خزندههای هوش مصنوعی تبدیل شده است.
فیدهای RSS به دلیل ساختار سبک، متنی و بهروزرسانی سریع، گزینهای عالی برای رباتهای هوش مصنوعی هستند تا بدون درگیر شدن با کدهای سنگین HTML و جاوااسکریپت، آخرین مقالات و تغییرات سایت شما را دریافت کنند.
```
پیشنهاد فنی: همیشه ساختار RSS سایت خود را فعال و بهروز نگه دارید تا الگوریتمهای هوش مصنوعی با کمترین استهلاک سرور، به جدیدترین مطالب شما دسترسی داشته باشند.