يرد ملف Sitemap وملف robots.txt متجاورين في كل قائمة تحقق للسيو، فيظنهما كثيرون وجهين لأداة واحدة، وهما ليسا كذلك. ملف Sitemap يساعد Google على اكتشاف روابطك، وملف robots.txt يخبر الزواحف بالمسارات المسموح لها بزيارتها. والنقطة التي يسبب سوء فهمها أكبر الضرر: ملف robots.txt ليس وسيلة لإبعاد صفحة عن نتائج Google.
ملفان ووظيفتان مختلفتان
ملف Sitemap بصيغة XML قائمة بالروابط التي تريد أن تعرفها Google. يساعد على الاكتشاف، خصوصًا للصفحات الجديدة أو التي لا تصلها روابط داخلية كثيرة. لكنه لا يفرض الفهرسة، ولا يضمن أن تزحف Google إلى كل رابط فيه.
أما robots.txt فملف نصي بسيط في جذر النطاق، مثل https://example.com/robots.txt، يحدد المسارات التي يجوز للزواحف طلبها. أي أنه يدير الزحف لا الفهرسة. وتقول Google ذلك صراحة: ملف robots.txt ليس آلية لإبعاد صفحة ويب عن Google، ولإبعادها عليك أن تمنع فهرستها بوسم noindex أو أن تحميها بكلمة مرور.
قبل أن تكتب أيًا من الملفين، تحقق مما لديك. تشير Google إلى أن أنظمة إدارة المحتوى مثل WordPress وWix وBlogger توفّر على الأرجح ملف Sitemap جاهزًا. ولاحظت أن مدونات عربية كثيرة تشغّل ملفين دون قصد، واحدًا من النظام وآخر من إضافة. اختر مصدرًا واحدًا.
خطوات إعداد الملفين
- اعثر على ملف Sitemap أو أنشئه. افتح
/sitemap.xmlأو راجع إعدادات نظام إدارة المحتوى أو إضافة السيو. وإن لم يوجد ملف، فولّده من النظام أو بسكربت. - التزم بالحدود. تحدد Google حجم ملف Sitemap الواحد بـ50MB دون ضغط أو 50,000 رابط. وإذا تجاوزت ذلك فقسّم القائمة إلى عدة ملفات واجمعها في ملف فهرس (sitemap index). ومن تجربتي، التقسيم حسب اللغة (
sitemap-ar.xmlوsitemap-en.xml) يجعل تقارير Search Console أسهل قراءة. - استخدم روابط مطلقة. تطلب Google روابط كاملة مطلقة، أي
https://example.com/ar/...لا/ar/.... - رمّز الروابط العربية بشكل صحيح. احفظ الملف بترميز UTF-8، واكتب المسارات العربية بصيغتها المرمّزة بالنسبة المئوية، وهي الصيغة التي توصي بها إرشادات Google لبنية الروابط للأحرف من خارج نطاق ASCII.
- أدرج الصفحات الأساسية القابلة للفهرسة فقط. استبعد الروابط المحوّلة، والصفحات التي عليها noindex، والنسخ المكررة.
- اضبط lastmod بأمانة وتجاهل الباقي. تتجاهل Google قيمتي
priorityوchangefreq، ولا تستخدمlastmodإلا إذا كانت دقيقة باستمرار ويمكن التحقق منها. غيّرها حين يتغير المحتوى فعلًا، لا على كل الصفحات كل ليلة. - أرسل الملف. أضفه في تقرير Sitemaps داخل Search Console، حيث ترى متى وصل إليه Googlebot، وأضف أيضًا سطر
Sitemap:في robots.txt. - اكتب robots.txt بعناية. تدعم Google أربعة حقول: user-agent وallow وdisallow وsitemap، ولا تدعم حقولًا أخرى مثل crawl-delay. واحرص على أن يبقى الملف أصغر بكثير من حد Google البالغ 500 KiB.
- لا تحجب ملفات العرض. لا تمنع مجلدات CSS وJavaScript والصور التي تحتاج إليها صفحاتك. تعرض Google الصفحات بنسخة حديثة من Chrome، والملفات المحجوبة قد تتركها أمام تصميم مكسور.
- أزل الصفحات بالطريقة الصحيحة. كل ما يجب أن يبقى خارج Google ضع عليه noindex أو احمه بكلمة مرور. وإذا منعت صفحة في robots.txt فلن تستطيع Google جلبها، ولن ترى بالتالي أي noindex عليها.
- احسب حساب التخزين المؤقت. تخزّن Google محتوى robots.txt مؤقتًا لمدة تصل إلى 24 ساعة عادة، فقد يستغرق التعديل يومًا حتى يُلتقط.
مثال: موقع ثنائي اللغة
هذا إدخال في ملف Sitemap لمقال عربي عنوانه المختصر تحسين-سرعة-الموقع، مكتوبًا بصيغته المرمّزة:
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/ar/%D8%AA%D8%AD%D8%B3%D9%8A%D9%86-%D8%B3%D8%B1%D8%B9%D8%A9-%D8%A7%D9%84%D9%85%D9%88%D9%82%D8%B9</loc>
<lastmod>2026-02-01</lastmod>
</url>
<url>
<loc>https://example.com/en/site-speed</loc>
<lastmod>2026-01-28</lastmod>
</url>
</urlset>
لا يوجد priority ولا changefreq لأن Google تتجاهلهما، وكل قيمة lastmod هي تاريخ آخر تعديل فعلي على نص المقال.
وهذا ملف robots.txt بسيط لموقع WordPress بقسمين عربي وإنجليزي:
User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Sitemap: https://example.com/sitemap-ar.xml Sitemap: https://example.com/sitemap-en.xml
يمنع الملف لوحة الإدارة، ويُبقي متاحًا ملفًا واحدًا تستدعيه واجهة الموقع عادة، ويشير إلى ملفي Sitemap للغتين. ولا يحجب القوالب ولا السكربتات ولا مجلد الرفع. والاختصار هنا ميزة برأيي: كلما قلّت القواعد قلّت فرص الخطأ.
قائمة التحقق
| الفحص | الطريقة | الأداة |
|---|---|---|
| مصدر واحد لملف Sitemap | تأكد من أن النظام والإضافات لا يولّدان ملفين | إعدادات نظام إدارة المحتوى |
| الالتزام بالحدود | عدّ الروابط وحجم كل ملف، وقسّم فوق 50,000 رابط أو 50MB | ملف Sitemap ومحرر نصوص |
| الروابط مطلقة ومرمّزة | افتح الملف وراجع عدة إدخالات عربية | المتصفح |
| روابط أساسية قابلة للفهرسة فقط | افحص عينة بحثًا عن تحويل أو noindex | أداة فحص عنوان URL في Search Console |
| قيمة lastmod دقيقة | قارن بعض التواريخ بتواريخ التعديل الفعلية | سجل التعديلات في نظام إدارة المحتوى |
| الملف مُرسل ومقروء | راجع الحالة وتاريخ آخر قراءة | تقرير Sitemaps في Search Console |
| حقول robots.txt مدعومة | احذف crawl-delay وأي سطر غير مدعوم | محرر نصوص |
| ملفات العرض غير محجوبة | تأكد من عدم وجود قاعدة تمنع مجلدات CSS أو JS أو الصور | مراجعة robots.txt وأداة فحص عنوان URL |
| الصفحات الخاصة محمية | استخدم noindex أو كلمة مرور لا disallow | إعدادات الصفحة وإعدادات الخادم |
أخطاء شائعة
- استخدام Disallow لإخراج صفحة من الفهرس. هذا يوقف الزحف لا الفهرسة، ويخفي عن Google أي noindex تضيفه.
- حجب CSS أو JavaScript. لا يوفّر شيئًا، وقد يجعل Google تعرض صفحتك مكسورة.
- إدراج روابط محوّلة أو عليها noindex أو غير أساسية في ملف Sitemap. هذا يرسل إشارات متضاربة عن الرابط الذي تريده.
- تحديث lastmod لكل الصفحات يوميًا. لا تستخدم Google هذه القيمة إلا إذا كانت دقيقة باستمرار، والتاريخ المزيف يفقدها قيمتها.
- الاعتماد على crawl-delay مع Googlebot. Google لا تدعم هذا الحقل.
- توقّع أن يضمن ملف Sitemap الفهرسة. هو يساعد على الاكتشاف، أما الفهرسة فتبقى قرار Google.
المصادر
- Google Search Central، توثيق إنشاء ملف Sitemap وإرساله، اطُّلع عليه في 4 فبراير 2026، https://developers.google.com/search/docs/crawling-indexing/sitemaps/build-sitemap
- Google Search Central، مقدمة عن ملف robots.txt، اطُّلع عليها في 4 فبراير 2026، https://developers.google.com/search/docs/crawling-indexing/robots/intro
- Google Search Central، توثيق طريقة تفسير Google لمواصفات robots.txt، اطُّلع عليه في 4 فبراير 2026، https://developers.google.com/search/docs/crawling-indexing/robots/robots_txt
- Google Search Central، أفضل ممارسات بنية عناوين URL (ترميز الأحرف من خارج نطاق ASCII بالنسبة المئوية)، اطُّلع عليه في 4 فبراير 2026، https://developers.google.com/search/docs/crawling-indexing/url-structure
- Google Search Central، توثيق طريقة عمل بحث Google (العرض بنسخة حديثة من Chrome)، اطُّلع عليه في 4 فبراير 2026، https://developers.google.com/search/docs/fundamentals/how-search-works