لو انت من الناس اللي بتتابع «مين بيزور موقعي» من لوحة الإحصائيات وشايف أسماء زي GPTBot عدّت من هنا، الخبر الوحش إن الرقم ده ممكن يكون بيكدب عليك. فيه دراسة على 314 موقع طلعت بنتيجة غريبة: الموقع اللي بيحجب الزاحف والموقع اللي مش بيحجبه بيسجّلوا نفس عدد الزيارات تقريباً. يعني لوجاتك مش قادرة تفرّق بين باب مفتوح وباب مقفول.
الأرقام التي تكشف المشكلة
أجرى فريق LovedByAI فحصاً على 314 موقعاً خلال أواخر أغسطس 2026، بانتحال 38 معرّف زاحف مختلف، ثم قارن النتيجة بأربعة أسابيع من سجلات السيرفر الحقيقية لتلك المواقع.
النتيجة الأساسية:
| الحالة | نسبة المواقع التي سجّلت طلباً من OAI-SearchBot |
|---|---|
| محجوب عند الأصل (Origin) | 84.6% |
| غير محجوب إطلاقاً | 87.3% |
| محجوب عند الحافة (Edge) | 0.0% |
ثلاث نقاط مئوية تفصل بين الحجب الفعلي وعدم الحجب. هذا الفارق لا يمكن البناء عليه في أي قرار.
بصراحة: هذه ليست مشكلة أدوات إحصاء رديئة، بل مشكلة في طبيعة القياس نفسه. لا توجد إضافة إحصائيات تستطيع حلها لأن البيانات التي تحتاجها غير موجودة في السجل أصلاً.
الحافة والأصل: مكانان مختلفان تماماً للحجب
الفرق بين الحالتين هو مفتاح فهم الموضوع كله.
الحجب عند الحافة (Edge) يحدث قبل وصول الطلب إلى سيرفرك: قاعدة في Cloudflare، أو جدار حماية على شبكة توصيل المحتوى (CDN)، أو جدار حماية التطبيقات (WAF). تطبيقك لا يعمل أصلاً، وسجل الوصول لا يحصل على سطر واحد. الزاحف يأخذ رمز 403 وينصرف.
الحجب عند الأصل (Origin) يحدث بعد الوصول: إضافة حماية في ووردبريس، أو قاعدة map على $http_user_agent في nginx، أو RewriteCond في Apache. الطلب يكمل الاتصال، ويصل إلى السيرفر، ويُسجَّل، ثم يُرفض.
هنا مصدر الوهم: الطلب المحجوب عند الأصل يظهر في سجلك بوصفه زيارة. إضافة إحصاء الزواحف تحسبه، ولوحتك تعرض لك أن GPTBot مرّ من هنا. وهو في الحقيقة خرج برمز 403 ولا شيء غيره.
الحجب عند الحافة صاخب في سجلك لأنه صامت تماماً. والحجب عند الأصل يختبئ في وضح النهار.
ولماذا لا يكفي ملف robots.txt؟
الغريزة الأولى أن تترك السجلات وتقرأ ملف robots.txt. المشكلة أن هذا الطريق أسوأ.
من بين 135 موقعاً كانت ترفض زاحفاً واحداً على الأقل، 23 موقعاً فقط كتب ذلك في ملفه. الـ 112 الباقية كانت ترفض عند السيرفر دون أي أثر مكتوب في إعدادات الموقع. الطلب يصل، والسيرفر يرد 403، وملف robots.txt لا يزال يبدو كسجادة ترحيب.
والعكس صحيح أيضاً، لأن robots.txt عرف متفق عليه لا آلية إلزام:
- 33.3% من المواقع التي تمنع GPTBot سجّلت طلبات صفحات حقيقية من GPTBot.
- 17.6% من المواقع التي تمنع ClaudeBot سجّلت طلبات منه.
الخلاصة المنهجية: ملف robots.txt يخبرك بما نويته. سجلاتك تخبرك بما وصل. ولا واحد منهما يخبرك بما حصل عليه الزاحف فعلاً.
الاختبار الوحيد الذي يعمل
أرسل الطلب بنفسك، منتحلاً هوية الزاحف، واقرأ رمز الحالة.
الجزء الذي يُهمَل عادة هو ضابط التحكم (Control). إذا أطلقت عشرة طلبات من اسم النطاق مثل arabcms.com إلى عنوان IP السيرفر الذي يستضيف الموقع. أي تعديل في سجلاته قد يحتاج ساعات…">DNS…">عنوان IP واحد وعادت كلها برمز 403، فأنت لم تتعلم شيئاً: قد يكون السبب عنوانك، أو محدّد معدل الطلبات، أو أن الموقع متوقف أصلاً. تحتاج طلباً بمعرّف محايد من نفس العنوان ليثبت أن الموقع يعمل، وأن الرفض سببه اسم الزاحف تحديداً.
#!/usr/bin/env bash
SITE="${1:?usage: ./crawlcheck.sh https://example.com}"
code() { curl -s -o /dev/null -w "%{http_code}" -A "$1" --max-time 15 "$SITE"; }
CONTROL=$(code "crawlcheck-control/1.0")
echo "control $CONTROL"
[ "$CONTROL" = "200" ] || { echo "control failed - results below are meaningless"; exit 1; }
for UA in
"GPTBot/1.2"
"OAI-SearchBot/1.0"
"ChatGPT-User/1.0"
"PerplexityBot/1.0"
"Claude-SearchBot/1.0"
"ClaudeBot/1.0"
"Bytespider"
"Amazonbot/0.1"
do
printf '%-18s %sn' "$(echo "$UA" | cut -d/ -f1)" "$(code "$UA")"
sleep 1
done
الرمز 200 يعني أن الزاحف يصل. والرمز 403 يعني أنك وجدت واحداً محجوباً.
ملاحظة: السطر sleep 1 ليس تفصيلاً تجميلياً. الفحص يطلق عشرات الطلبات المتتالية، وهذا وحده كافٍ لتفعيل محدّد معدل الطلبات على أغلب الاستضافات المشتركة. رمز 429 يخبرك عن كثافة طلباتك أنت، لا عن موقف موقعك من زواحف الذكاء الاصطناعي. الفريق استبعد كل استجابات 429 من أرقام الدراسة، ولولا ذلك لأضافت 107 حالات رفض وهمية عبر 39 موقعاً.
كيف يبدو الرفض في الواقع؟
من بين 558 حالة رفض كان robots.txt فيها يسمح للزاحف صراحة:
- 509 حالة كانت 403 Forbidden بسيطة، أي 93% من الإجمالي.
- 24 حالة تحدي متصفح من Cloudflare، وهو بالنسبة لبوت باب مقفل لا لغز.
- 20 حالة 406 Not Acceptable، وهي عادة قاعدة على مستوى خادم الويب.
- 5 حالات 403 من قاعدة مُدارة في Cloudflare.
نسبة الـ 93% هي الجزء المفيد. إنها بصمة قاعدة مبنية على سلسلة اسم الزاحف ولا شيء غيرها: لا سلوك، ولا معدل، ولا بصمة متصفح. مجرد مطابقة نصية على قائمة لصقها أحدهم منذ سنوات.
ولهذا بالضبط يُحجب زواحف لم يقصد أحد حجبها. زر «امنع البوتات الضارة» الذي فُعِّل في 2021 لم يكن يعلم أن ChatGPT-User سيوجد في 2026.
هذه النقطة تخص قارئ المنطقة تحديداً: كثير من مواقع ووردبريس العربية بُنيت على استضافات مشتركة بقوائم حجب جاهزة، أو بإضافة حماية فُعِّلت مرة ونُسيت. إذا كنت قد ضغطت يوماً على خيار حظر الروبوتات في لوحة الاستضافة أو في إضافة الحماية، فأنت مرشّح قوي لأن تكتشف رمز 403 في المخرجات.
فرّق بين نوعي الزواحف قبل أن تقرر
الأسماء لا تساعد إطلاقاً، والخلط بينها هو أصل معظم الحجب غير المقصود:
- زواحف التدريب: GPTBot و CCBot و Bytespider و Amazonbot و Google-Extended. تأخذ المحتوى لتدريب النماذج. حجبها موقف مشروع وشائع ولا يكلفك ظهوراً في بحث الذكاء الاصطناعي.
- زواحف المساعدين: OAI-SearchBot و ChatGPT-User و PerplexityBot و Claude-SearchBot و DuckAssistBot. تجلب الصفحة لأن مستخدماً سأل سؤالاً للتو، والإجابة تنتهي باستشهاد يحمل رابطك.
المثال الأوضح: GPTBot و OAI-SearchBot كلاهما من OpenAI، ويؤديان وظيفتين مختلفتين تماماً. قاعدة تطابق كلمة GPT تصطاد الأول فقط، وقاعدة تطابق OpenAI أو مرشّح بوتات شامل يصطاد الاثنين معاً.
في العينة، 102 موقعاً من الـ 135 كانت تحجب زواحف التدريب فقط، بشكل متعمد ومتّسق. و33 موقعاً كانت تحجب زاحف مساعد واحداً على الأقل، 31 منها لم تكتب ذلك في أي مكان. هذا ليس سياسة، هذا أثر جانبي.
ما لم تستطع الدراسة إثباته
الأمانة هنا تستحق التنويه: الفريق نشر أيضاً ما فشل في إثباته.
السؤال الأهم هو هل تحصل المواقع المحجوبة على زيارات إحالة أقل من أدوات الذكاء الاصطناعي. الأرقام من يونيو إلى أغسطس: وسيط 12 زيارة للمواقع الـ 269 المتاحة، و6 لأحد عشر موقعاً تحجب OpenAI عند الحافة، و5 لسبعة عشر موقعاً تحجب عند الأصل. الاتجاه يبدو منطقياً، ثم جاءت سبعة عشر موقعاً تمنع OpenAI في robots.txt بوسيط 19 زيارة، أي أعلى من المجموعة المتاحة تماماً.
مجموعات من 11 إلى 17 موقعاً، بلا ضبط لحجم الموقع أو مجاله، تعني ضجيجاً إحصائياً لا نتيجة. وقولها صراحة أفضل من تلبيسها ثوب الاستنتاج.
ماذا تفعل الآن؟
- شغّل السكربت على نطاقك. يستغرق عشر ثوانٍ.
- إن رجع الضابط 200 ورجع أي زاحف 403، راجع ثلاثة أماكن بالترتيب: قواعد Cloudflare، ثم إعدادات إضافة الحماية في ووردبريس، ثم قواعد خادم الويب في
.htaccessأو إعداد nginx. - قرّر بوعي: امنع زواحف التدريب إن أردت، واترك زواحف المساعدين مفتوحة إن كنت تريد أن يُستشهد بمحتواك.
- اكتب قرارك في
robots.txtحتى لو كان الحجب الفعلي في مكان آخر، لأن الموقف المكتوب يوفّر على من يأتي بعدك ساعة من التخمين.
الخلاصة
أقلية كبيرة من المواقع ترفض زواحف الذكاء الاصطناعي، ومعظمها لا يستطيع رؤية ذلك من إعداداته الخاصة، وأكثر أنواع الحجب شيوعاً هو النوع الذي لا تستطيع سجلاتك تمييزه عن النجاح. الاختبار المباشر برمز الحالة هو المصدر الوحيد الموثوق.
خد عشر ثواني وشغّل السكربت على موقعك دلوقتي، وقول لنا في التعليقات طلع معاك كام 403. الأغلب هتتفاجئ.
المصدر الأصلي: How to check if your site is blocking AI crawlers (robots.txt won’t tell you) — https://dev.to/lovedbyai/your-logs-cant-tell-a-blocked-ai-crawler-from-a-happy-one-5g0o
ملاحظة للتحرير: الدراسة منشورة من فريق منتج تجاري في هذا المجال؛ الأرقام والمنهجية معروضة كما وردت في المصدر، وأُسقطت من النسخة العربية الفقرة الترويجية الخاصة بالمنتج.
اقرأ أيضًا
الأسئلة الشائعة
كيف أعرف أن موقعي يحجب زواحف الذكاء الاصطناعي؟
أرسل طلباً لموقعك بنفسك وأنت تنتحل اسم الزاحف، واقرأ رمز الاستجابة. أرسل قبله طلباً بمعرّف محايد كضابط تحكم؛ إن رجع الضابط 200 ورجع الزاحف 403 فأنت أمام حجب مؤكد مبني على اسم الزاحف.
ألا تكفي مراجعة ملف robots.txt؟
لا. ملف robots.txt يعبّر عن نيتك المكتوبة فقط، والحجب الفعلي يقع غالباً في السيرفر أو في Cloudflare دون أي أثر فيه. في دراسة على 314 موقعاً، 135 موقعاً كان يرفض زاحفاً واحداً على الأقل بينما 23 موقعاً فقط كتب ذلك في الملف.
ما الفرق بين زواحف التدريب وزواحف المساعدين؟
زواحف التدريب مثل GPTBot تأخذ المحتوى لتدريب النماذج. زواحف المساعدين مثل OAI-SearchBot و PerplexityBot تجلب الصفحة لأن مستخدماً سأل سؤالاً الآن، والإجابة تنتهي باستشهاد يحمل رابطك.
هل حجب زواحف الذكاء الاصطناعي يضر بزياراتي؟
البيانات المتاحة في الدراسة لا تثبت ذلك بشكل قاطع لصغر العينة. لكن المؤكد أن حجب زواحف المساعدين يمنع الاستشهاد برابطك في الإجابات، بينما حجب زواحف التدريب موقف مشروع لا يكلفك ظهوراً في البحث.
لماذا يظهر الزاحف في سجلاتي رغم أنني أحجبه؟
لأن الحجب عند الأصل يحدث بعد وصول الطلب إلى السيرفر، فيُسجَّل الطلب أولاً ثم يُرفض برمز 403. سجلك يرى «زيارة» بينما الزاحف خرج صفر اليدين.



