← اخبار

نحوه خواندن سایت‌مپ توسط ربات‌های هوش مصنوعی؛ افشاگری جان مولر

نحوه خواندن سایت‌مپ توسط ربات‌های هوش مصنوعی؛ افشاگری جان مو

جان مولر، تحلیل‌گر و نماینده ارشد گوگل، به‌تازگی با بررسی لاگ‌های سرور شخصی خود نکته فنی و بسیار مهمی را درباره نحوه عملکرد ربات‌های هوش مصنوعی افشا کرده است. به گفته او، خزنده‌های آموزش مدل‌های زبانی بر خلاف موتورهای جستجوی سنتی، ابزار اختصاصی برای ثبت دستی نقشه سایت ندارند و برای کشف محتوا، به نام‌های پیش‌فرض سایت‌مپ و خوراک RSS متکی هستند.

ماجرای بررسی لاگ‌های سرور توسط جان مولر چیست؟

دنیای هوش مصنوعی و مدل‌های بزرگ زبانی (LLM) با سرعتی باورنکردنی در حال رشد است. شرکت‌هایی مانند OpenAI، Anthropic و Perplexity برای آموزش مدل‌های خود و ارائه پاسخ‌های به‌روز به کاربران، نیازمند جمع‌آوری داده از سراسر وب هستند. اما این خزنده‌ها (AI Crawlers) چگونه صفحات جدید وب‌سایت‌ها را پیدا می‌کنند؟

جان مولر (John Mueller) با تحلیل لاگ‌های سرور (Server Logs) وب‌سایت خود متوجه رفتار جالبی از سوی این خزنده‌ها شد. برخلاف گوگل و بینگ که ابزارهای پیشرفته‌ای مانند «گوگل سرچ کنسول» را برای معرفی مستقیم نقشه سایت (Sitemap) در اختیار وب‌مسترها قرار می‌دهند، اکثر خزنده‌های هوش مصنوعی چنین بستر مستقیمی ندارند.

طبق مشاهدات مولر، این ربات‌ها به‌طور خودکار به دنبال آدرس‌های استاندارد و پیش‌فرض نقشه سایت و همچنین فیدهای خبری می‌گردند تا محتوای جدید را بازخوانی کنند.

چرا خزنده‌های هوش مصنوعی کنسول اختصاصی ندارند؟

موتورهای جستجوی سنتی برای رتبه‌بندی دقیق، بررسی جریمه‌ها و مدیریت اندکس صفحات، نیازمند ارتباط دوطرفه با صاحبان سایت‌ها هستند. اما هدف اصلی خزنده‌های هوش مصنوعی در حال حاضر، جمع‌آوری متون و داده‌های متنی برای آموزش مدل‌ها یا استخراج اطلاعات است. از همین رو، این شرکت‌ها هنوز زیرساختی مشابه سرچ کنسول برای دریافت دستی لینک‌ها طراحی نکرده‌اند و فرآیند کاوش (Crawling) آن‌ها کاملاً متکی بر روندهای خودکار است.

``
تفاوت اصلی: موتورهای جستجو بستری برای ثبت دستی (Submission) دارند، اما خزنده‌های هوش مصنوعی متکی بر آدرس‌های استاندارد و ساختاریافته هستند.
`

نقش کلیدی نام‌های پیش‌فرض سایت‌مپ (Sitemap)

یکی از مهم‌ترین نکات مطرح‌شده توسط جان مولر، اهمیت استفاده از نام‌ها و مسیرهای استاندارد برای فایل نقشه سایت است. بسیاری از مدیران سایت‌ها برای مسائل امنیتی یا ساختار کدهای اختصاصی، آدرس سایت‌مپ خود را تغییر می‌دهند (برای مثال: my-custom-sitemap.xml).

مولر توضیح می‌دهد که خزنده‌های هوش مصنوعی به‌طور معمول آدرس‌های استاندارد زیر را درخواست می‌کنند:

* example.com/sitemap.xml
*
example.com/sitemap_index.xml

اگر وب‌سایت شما از نام‌های غیرمعمول استفاده کند و این آدرس‌ها در فایل robots.txt نیز به‌درستی معرفی نشده باشند، ربات‌های هوش مصنوعی احتمالاً نمی‌توانند نقشه سایت شما را پیدا کنند. این موضوع باعث می‌شود محتوای جدید شما در بازه زمانی طولانی‌تری توسط هوش مصنوعی کشف شود یا حتی کلاً از دید آن‌ها پنهان بماند.

تجدید حیات خوراک RSS در عصر هوش مصنوعی

نکته غافلگیرکننده دیگری که در لاگ‌های سرور جان مولر مشاهده شد، توجه ویژه خزنده‌های هوش مصنوعی به خوراک RSS یا Atom بود. در حالی که طی سال‌های اخیر بسیاری از کاربران سنتی استفاده از RSS خوان‌ها را کنار گذاشته‌اند، اما این تکنولوژی قدیمی به ابزاری محبوب برای خزنده‌های هوش مصنوعی تبدیل شده است.

فیدهای RSS به دلیل ساختار سبک، متنی و به‌روزرسانی سریع، گزینه‌ای عالی برای ربات‌های هوش مصنوعی هستند تا بدون درگیر شدن با کدهای سنگین HTML و جاوااسکریپت، آخرین مقالات و تغییرات سایت شما را دریافت کنند.

`
پیشنهاد فنی: همیشه ساختار RSS سایت خود را فعال و به‌روز نگه دارید تا الگوریتم‌های هوش مصنوعی با کمترین استهلاک سرور، به جدیدترین مطالب شما دسترسی داشته باشند.
``

راهک

مطالب مرتبط

seo
مجله تیکینو

نیاز به مشاوره دارید؟

تیم تیکینو آماده کمک به شماست

درخواست مشاوره رایگان