خزندهٔ NeshatScan
NeshatScan چه میخواند، چطور خودش را معرفی میکند، کی سر میزند و چطور جلویش را بگیرید. هر درخواست یک صفحه، پایبند دستور سایت شما به رباتها.
NeshatScan همان ابزاری است که اسکن رایگان این سایت صفحهها را با آن دریافت میکند. به معنای رایج کلمه، خزنده نیست. وقتی کسی اسکن سایتی را درخواست کند، به آن سایت سر میزند؛ و در چهار حالت دیگر هم، که هر کدام به درخواست یک آدم برمیگردد: یک بار، هفت روز بعد از اینکه کسی گزارش آن سایت را برای خودش ایمیل کرده باشد؛ هر هفته، برای دامنهای که اشتراک «پایش ماهانه» دارد؛ وقتی Fix Pack آن دامنه خریده شود یا صاحبش دکمهٔ «Re-scan to verify» (اسکن دوباره برای تأیید) را بزند؛ و برای پژوهش خودم دربارهٔ اینکه در یک صنف، کدام کسبوکارها برای موتورهای پاسخگو در دسترساند، حداکثر روزی یک بار برای هر سایت. در هر بار سر زدن، حداکثر پنج نشانی را دریافت میکند.
خودش را چطور معرفی میکند
هر درخواست این شناسه را در هدر User-Agent میفرستد: NeshatScan/1.0 (+https://neshat.ai/scan/bot/)
چه چیزهایی را دریافت میکند
/robots.txt- همان یک صفحهای که بازدیدکننده وارد کرده است (یا صفحهٔ اصلی)
- نقشهٔ سایتی که در robots.txt معرفی شده، یا
/sitemap.xml /llms.txt
از هر صفحه حداکثر دو مگابایت و از هر نقشهٔ سایت حداکثر یک مگابایت را میخواند، حداکثر پنج ریدایرکت را دنبال میکند، و هر درخواستی را که بیش از چند ثانیه طول بکشد رها میکند. هیچ کوکی یا اطلاعات ورود به حسابی نمیفرستد. نتیجهٔ هر نشانی پانزده دقیقه در حافظهٔ موقت میماند، و هر چند نفر هم که درخواست بدهند، هیچ سایتی در ده دقیقه بیش از چند بار اسکن نمیشود.
چه چیزهایی را هرگز دریافت نمیکند
هر چیزی که سایت عمومی نباشد: شبکههای خصوصی، نشانیهای فرادادهٔ سرویسهای ابری، نامهای میزبانی که به محدودههای نشانی داخلی ترجمه میشوند، پورتهای غیراستاندارد، و هر چیزی که از راه ریدایرکت به یکی از اینها برسد. این درخواستها پیش از باز شدن هر اتصالی رد میشوند.
چطور جلویش را بگیرید
یک گروه برای شناسهٔ آن به فایل robots.txt سایتتان اضافه کنید؛ از آن به بعد سایت شما را اسکن نمیکند و به بازدیدکننده نشان میدهد که شما خواستهاید اسکن نشود:
User-agent: NeshatScan
Disallow: /درخواستها از کجا میآیند
اسکن روی زیرساخت بدونسرورِ Vercel در ایالات متحده اجرا میشود، پس درخواستها از یک نشانی IP ثابت نمیآیند. آن را از روی هدر User-Agent شناسایی کنید.
خزندههایی که اسکن دربارهٔ آنها گزارش میدهد
اسکن دسترسی این شناسهها را بررسی میکند؛ هر کدام به مستندات سازندهاش پیوند دارد که آن را توضیح میدهد:
OAI-SearchBot— OpenAI · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)Claude-SearchBot— Anthropic · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)PerplexityBot— Perplexity · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)ChatGPT-User— OpenAI · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)Claude-User— Anthropic · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)Perplexity-User— Perplexity · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)Googlebot— Google · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)Bingbot— Microsoft · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)Applebot— Apple · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)GPTBot— OpenAI · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)ClaudeBot— Anthropic · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)CCBot— Common Crawl · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)Bytespider— ByteDance · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)Meta-ExternalAgent— Meta · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)Google-Extended— Google · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)Applebot-Extended— Apple · مستندات (بررسیشده در ۲۲ سپتامبر ۲۰۲۶)
دربارهٔ یک درخواست مشخص سؤالی دارید؟ زمان درخواست و دامنهٔ سایتتان را برایم بنویسید، یا اسکن را روی همین سایت اجرا کنید تا ببینید دقیقاً به چه چیزهایی نگاه میکند.
