ملف Sitemap وملف robots.txt: ما الذي يتحكم فيه كل منهما فعلًا

وقت القراءة: 7 دقيقة
18
techkahwa.net | 4 فبراير 2026

يرد ملف Sitemap وملف robots.txt متجاورين في كل قائمة تحقق للسيو، فيظنهما كثيرون وجهين لأداة واحدة، وهما ليسا كذلك. ملف Sitemap يساعد Google على اكتشاف روابطك، وملف robots.txt يخبر الزواحف بالمسارات المسموح لها بزيارتها. والنقطة التي يسبب سوء فهمها أكبر الضرر: ملف robots.txt ليس وسيلة لإبعاد صفحة عن نتائج Google.

ملفان ووظيفتان مختلفتان

ملف Sitemap بصيغة XML قائمة بالروابط التي تريد أن تعرفها Google. يساعد على الاكتشاف، خصوصًا للصفحات الجديدة أو التي لا تصلها روابط داخلية كثيرة. لكنه لا يفرض الفهرسة، ولا يضمن أن تزحف Google إلى كل رابط فيه.

أما robots.txt فملف نصي بسيط في جذر النطاق، مثل https://example.com/robots.txt، يحدد المسارات التي يجوز للزواحف طلبها. أي أنه يدير الزحف لا الفهرسة. وتقول Google ذلك صراحة: ملف robots.txt ليس آلية لإبعاد صفحة ويب عن Google، ولإبعادها عليك أن تمنع فهرستها بوسم noindex أو أن تحميها بكلمة مرور.

قبل أن تكتب أيًا من الملفين، تحقق مما لديك. تشير Google إلى أن أنظمة إدارة المحتوى مثل WordPress وWix وBlogger توفّر على الأرجح ملف Sitemap جاهزًا. ولاحظت أن مدونات عربية كثيرة تشغّل ملفين دون قصد، واحدًا من النظام وآخر من إضافة. اختر مصدرًا واحدًا.

خطوات إعداد الملفين

  1. اعثر على ملف Sitemap أو أنشئه. افتح /sitemap.xml أو راجع إعدادات نظام إدارة المحتوى أو إضافة السيو. وإن لم يوجد ملف، فولّده من النظام أو بسكربت.
  2. التزم بالحدود. تحدد Google حجم ملف Sitemap الواحد بـ50MB دون ضغط أو 50,000 رابط. وإذا تجاوزت ذلك فقسّم القائمة إلى عدة ملفات واجمعها في ملف فهرس (sitemap index). ومن تجربتي، التقسيم حسب اللغة (sitemap-ar.xml وsitemap-en.xml) يجعل تقارير Search Console أسهل قراءة.
  3. استخدم روابط مطلقة. تطلب Google روابط كاملة مطلقة، أي https://example.com/ar/... لا /ar/....
  4. رمّز الروابط العربية بشكل صحيح. احفظ الملف بترميز UTF-8، واكتب المسارات العربية بصيغتها المرمّزة بالنسبة المئوية، وهي الصيغة التي توصي بها إرشادات Google لبنية الروابط للأحرف من خارج نطاق ASCII.
  5. أدرج الصفحات الأساسية القابلة للفهرسة فقط. استبعد الروابط المحوّلة، والصفحات التي عليها noindex، والنسخ المكررة.
  6. اضبط lastmod بأمانة وتجاهل الباقي. تتجاهل Google قيمتي priority وchangefreq، ولا تستخدم lastmod إلا إذا كانت دقيقة باستمرار ويمكن التحقق منها. غيّرها حين يتغير المحتوى فعلًا، لا على كل الصفحات كل ليلة.
  7. أرسل الملف. أضفه في تقرير Sitemaps داخل Search Console، حيث ترى متى وصل إليه Googlebot، وأضف أيضًا سطر Sitemap: في robots.txt.
  8. اكتب robots.txt بعناية. تدعم Google أربعة حقول: user-agent وallow وdisallow وsitemap، ولا تدعم حقولًا أخرى مثل crawl-delay. واحرص على أن يبقى الملف أصغر بكثير من حد Google البالغ 500 KiB.
  9. لا تحجب ملفات العرض. لا تمنع مجلدات CSS وJavaScript والصور التي تحتاج إليها صفحاتك. تعرض Google الصفحات بنسخة حديثة من Chrome، والملفات المحجوبة قد تتركها أمام تصميم مكسور.
  10. أزل الصفحات بالطريقة الصحيحة. كل ما يجب أن يبقى خارج Google ضع عليه noindex أو احمه بكلمة مرور. وإذا منعت صفحة في robots.txt فلن تستطيع Google جلبها، ولن ترى بالتالي أي noindex عليها.
  11. احسب حساب التخزين المؤقت. تخزّن Google محتوى robots.txt مؤقتًا لمدة تصل إلى 24 ساعة عادة، فقد يستغرق التعديل يومًا حتى يُلتقط.

مثال: موقع ثنائي اللغة

هذا إدخال في ملف Sitemap لمقال عربي عنوانه المختصر تحسين-سرعة-الموقع، مكتوبًا بصيغته المرمّزة:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/ar/%D8%AA%D8%AD%D8%B3%D9%8A%D9%86-%D8%B3%D8%B1%D8%B9%D8%A9-%D8%A7%D9%84%D9%85%D9%88%D9%82%D8%B9</loc>
    <lastmod>2026-02-01</lastmod>
  </url>
  <url>
    <loc>https://example.com/en/site-speed</loc>
    <lastmod>2026-01-28</lastmod>
  </url>
</urlset>

لا يوجد priority ولا changefreq لأن Google تتجاهلهما، وكل قيمة lastmod هي تاريخ آخر تعديل فعلي على نص المقال.

وهذا ملف robots.txt بسيط لموقع WordPress بقسمين عربي وإنجليزي:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap-ar.xml
Sitemap: https://example.com/sitemap-en.xml

يمنع الملف لوحة الإدارة، ويُبقي متاحًا ملفًا واحدًا تستدعيه واجهة الموقع عادة، ويشير إلى ملفي Sitemap للغتين. ولا يحجب القوالب ولا السكربتات ولا مجلد الرفع. والاختصار هنا ميزة برأيي: كلما قلّت القواعد قلّت فرص الخطأ.

قائمة التحقق

الفحص الطريقة الأداة
مصدر واحد لملف Sitemap تأكد من أن النظام والإضافات لا يولّدان ملفين إعدادات نظام إدارة المحتوى
الالتزام بالحدود عدّ الروابط وحجم كل ملف، وقسّم فوق 50,000 رابط أو 50MB ملف Sitemap ومحرر نصوص
الروابط مطلقة ومرمّزة افتح الملف وراجع عدة إدخالات عربية المتصفح
روابط أساسية قابلة للفهرسة فقط افحص عينة بحثًا عن تحويل أو noindex أداة فحص عنوان URL في Search Console
قيمة lastmod دقيقة قارن بعض التواريخ بتواريخ التعديل الفعلية سجل التعديلات في نظام إدارة المحتوى
الملف مُرسل ومقروء راجع الحالة وتاريخ آخر قراءة تقرير Sitemaps في Search Console
حقول robots.txt مدعومة احذف crawl-delay وأي سطر غير مدعوم محرر نصوص
ملفات العرض غير محجوبة تأكد من عدم وجود قاعدة تمنع مجلدات CSS أو JS أو الصور مراجعة robots.txt وأداة فحص عنوان URL
الصفحات الخاصة محمية استخدم noindex أو كلمة مرور لا disallow إعدادات الصفحة وإعدادات الخادم

أخطاء شائعة

  • استخدام Disallow لإخراج صفحة من الفهرس. هذا يوقف الزحف لا الفهرسة، ويخفي عن Google أي noindex تضيفه.
  • حجب CSS أو JavaScript. لا يوفّر شيئًا، وقد يجعل Google تعرض صفحتك مكسورة.
  • إدراج روابط محوّلة أو عليها noindex أو غير أساسية في ملف Sitemap. هذا يرسل إشارات متضاربة عن الرابط الذي تريده.
  • تحديث lastmod لكل الصفحات يوميًا. لا تستخدم Google هذه القيمة إلا إذا كانت دقيقة باستمرار، والتاريخ المزيف يفقدها قيمتها.
  • الاعتماد على crawl-delay مع Googlebot. Google لا تدعم هذا الحقل.
  • توقّع أن يضمن ملف Sitemap الفهرسة. هو يساعد على الاكتشاف، أما الفهرسة فتبقى قرار Google.

المصادر

  • Google Search Central، توثيق إنشاء ملف Sitemap وإرساله، اطُّلع عليه في 4 فبراير 2026، https://developers.google.com/search/docs/crawling-indexing/sitemaps/build-sitemap
  • Google Search Central، مقدمة عن ملف robots.txt، اطُّلع عليها في 4 فبراير 2026، https://developers.google.com/search/docs/crawling-indexing/robots/intro
  • Google Search Central، توثيق طريقة تفسير Google لمواصفات robots.txt، اطُّلع عليه في 4 فبراير 2026، https://developers.google.com/search/docs/crawling-indexing/robots/robots_txt
  • Google Search Central، أفضل ممارسات بنية عناوين URL (ترميز الأحرف من خارج نطاق ASCII بالنسبة المئوية)، اطُّلع عليه في 4 فبراير 2026، https://developers.google.com/search/docs/crawling-indexing/url-structure
  • Google Search Central، توثيق طريقة عمل بحث Google (العرض بنسخة حديثة من Chrome)، اطُّلع عليه في 4 فبراير 2026، https://developers.google.com/search/docs/fundamentals/how-search-works