ایندکس شدن در گوگل یکی از اولین مراحل دیدهشدن یک سایت در نتایج جستجو است؛ اما صرفاً قرار دادن یک صفحه روی سایت یا ارسال Sitemap به Google Search Console به این معنی نیست که صفحه حتماً وارد ایندکس گوگل میشود. گوگل ابتدا باید بتواند صفحه را پیدا و Crawl کند، به آن دسترسی داشته باشد و سپس تشخیص دهد که صفحه شرایط لازم برای قرار گرفتن در نتایج جستجو را دارد. خود گوگل نیز تأکید میکند که حتی رعایت الزامات فنی، ایندکس شدن را تضمین نمیکند.
در نتیجه، وقتی یک صفحه در گوگل نمایش داده نمیشود، نباید بلافاصله مشکل را به Sitemap یا Search Console نسبت داد. برای پیدا کردن علت واقعی، باید مسیر Discovery → Crawling → Indexing را مرحلهبهمرحله بررسی کرد.
تفاوت Crawl و Index چیست؟
قبل از بررسی مشکلات، باید دو مفهوم مهم را از یکدیگر جدا کنیم.
Crawling یعنی Googlebot صفحه را پیدا کرده و محتوای آن را بررسی میکند. Indexing مرحلهای بعد از آن است که گوگل درباره نگهداری صفحه در فهرست صفحات قابل نمایش خود تصمیم میگیرد.
بنابراین ممکن است گوگل یک صفحه را Crawl کرده باشد اما آن را Index نکرده باشد. برای مثال، در Search Console ممکن است با وضعیت Crawled – currently not indexed مواجه شوید. از طرف دیگر، ممکن است گوگل هنوز صفحه را Crawl نکرده باشد و وضعیتهایی مانند Discovered – currently not indexed مشاهده شود. این دو وضعیت علت و راهکار یکسانی ندارند.
۱. وجود تگ Noindex
یکی از سادهترین اما مهمترین دلایل ایندکس نشدن صفحات، وجود دستور noindex است.
این دستور میتواند در HTML صفحه به شکل زیر قرار گرفته باشد:
<meta name="robots" content="noindex">
یا از طریق هدر HTTP با X-Robots-Tag ارسال شود. وقتی Googlebot بتواند این دستور را ببیند، صفحه را از نتایج جستجو حذف میکند.
این مشکل در سایتهای وردپرسی گاهی به دلیل تنظیمات افزونههای SEO یا فعال بودن گزینه جلوگیری از نمایش سایت در موتورهای جستجو ایجاد میشود.
بنابراین برای صفحاتی که قرار است در گوگل رتبه بگیرند، باید وضعیت Index / Follow و تنظیمات مربوط به Robots بررسی شود.
بنابراین یا هیچ تگی وجود نداشته باشد (رویکرد گوگل برای صفحاتی که هیچ تگی ندارند یا از طریق تنظمیات Robots دسترسی ربات ها مسدود نشده باشند crawl کردن و ایندکس صفحه است) یا برای اطمینان میتوان از تگ زیر استفاده کرد:
<meta name="robots" content="index, follow">
۲. مسدود شدن صفحه در Robots.txt
فایل robots.txt مشخص میکند Googlebot اجازه دسترسی به چه بخشهایی از سایت را دارد.
برای مثال:
User-agent: * Disallow: /blog/
میتواند دسترسی خزندهها به مسیر /blog/ را محدود کند.
نکته مهم این است که robots.txt با noindex یکسان نیست. Robots.txt در درجه اول دسترسی خزنده به URL را کنترل میکند، در حالی که noindex مستقیماً به موتور جستجو میگوید صفحه را در نتایج جستجو قرار ندهد. گوگل توصیه میکند برای جلوگیری از ایندکس یک صفحه، از noindex استفاده شود و صفحه برای Googlebot قابل Crawl باشد.
۳. مشکل Canonical
Canonical یکی از موارد مهم در تشخیص URL اصلی صفحات مشابه است.
فرض کنید یک صفحه با این آدرس وجود دارد:
example.com/product/a
اما در کد صفحه Canonical به این URL اشاره میکند:
<link rel="canonical" href="https://example.com/product/b">
در این شرایط به گوگل اعلام شده که نسخه اصلی صفحه B است و صفحه A نسخه جایگزین محسوب میشود.
حتی اگر Canonical را درست تنظیم کرده باشید، گوگل الزاماً Canonical اعلامشده توسط سایت را انتخاب نمیکند و ممکن است خودش URL دیگری را به عنوان نسخه اصلی انتخاب کند. این موضوع را میتوان در URL Inspection در بخش User-declared canonical و Google-selected canonical بررسی کرد.
۴. مشکل Sitemap
Sitemap به گوگل کمک میکند URLهای مهم سایت را پیدا کند؛ اما یک تصور اشتباه رایج این است که:
«اگر URL را در Sitemap قرار بدهم، حتماً ایندکس میشود.»
چنین تضمینی وجود ندارد.
Sitemap بیشتر یک سیگنال برای کشف URLهاست و به تنهایی باعث ایندکس شدن صفحه یا افزایش رتبه آن نمیشود.
بنابراین Sitemap باید شامل URLهای قابل ایندکس، اصلی و ارزشمند سایت باشد، نه صفحات تکراری، فیلترها، صفحات بیارزش یا URLهایی که قرار نیست در نتایج گوگل دیده شوند.
۵. صفحه هیچ لینک داخلی مناسبی ندارد
گوگل باید بتواند صفحات سایت را پیدا کند.
اگر یک مقاله فقط در Sitemap وجود داشته باشد اما هیچ لینک داخلی مناسبی از صفحات دیگر سایت به آن وجود نداشته باشد، کشف آن میتواند دشوارتر شود.
به همین دلیل بهتر است مقالات جدید از بخشهایی مانند:
- صفحه اصلی
- صفحه بلاگ
- مقالات مرتبط
- دستهبندیها
- صفحات خدمات
- مقالات قدیمی مرتبط
لینک دریافت کنند.
گوگل نیز استفاده از لینکهای استاندارد و Crawlable را برای کمک به کشف URLها توصیه میکند.
۶. خطای HTTP یا مشکلات سرور
اگر Googlebot هنگام مراجعه به صفحه با خطاهایی مانند:
۴۰۴ Not Found ۴۰۳ Forbidden ۵۰۰ Internal Server Error ۵۰۲ Bad Gateway ۵۰۳ Service Unavailable ۵۰۴ Gateway Timeout
مواجه شود، فرآیند Crawl و Indexing دچار مشکل خواهد شد.
طبق الزامات فنی گوگل، صفحهای که قرار است ایندکس شود باید برای Googlebot قابل دسترسی باشد و پاسخ موفقیتآمیز HTTP، معمولاً ۲۰۰ OK، ارائه کند.
به همین دلیل اگر سایت گاهی با ۵۰۴ یا خطاهای سرور مواجه میشود، بررسی این موضوع در کنار Search Console و لاگهای سرور اهمیت زیادی دارد.
۷. صفحه توسط گوگل Crawl شده اما ارزش کافی برای Indexing ندارد
این یکی از مهمترین بخشهای مسئله است.
گاهی هیچ مشکل فنی جدی وجود ندارد؛ Googlebot صفحه را باز کرده، محتوا را خوانده اما صفحه را وارد ایندکس نکرده است.
در Search Console ممکن است چنین صفحهای با وضعیت:
Crawled – currently not indexed
نمایش داده شود.
در این شرایط باید خود محتوا بررسی شود:
- آیا محتوا واقعاً اطلاعات جدیدی ارائه میکند؟
- آیا با مقاله دیگری در سایت تفاوت معناداری دارد؟
- آیا صفحه بیش از حد کوتاه و سطحی است؟
- آیا بخش زیادی از آن از منابع دیگر تکرار شده است؟
- آیا صفحه برای کاربر ارزش مشخصی ایجاد میکند؟
در چنین شرایطی، صرفاً درخواست Indexing مجدد لزوماً مشکل را حل نمیکند.
۸. محتوای تکراری
Duplicate Content نیز میتواند باعث شود گوگل به جای چند URL مشابه، یک نسخه را به عنوان URL اصلی انتخاب کند.
برای مثال ممکن است یک مقاله از چند URL مختلف قابل دسترسی باشد:
/article/example /article/example/ /?post=123 /category/example/article/example
اگر سایت بهدرستی URLهای اصلی را مدیریت نکند، گوگل باید بین نسخههای مشابه تصمیم بگیرد.
Canonical، Redirect، ساختار URL و لینکهای داخلی باید در کنار یکدیگر بررسی شوند.
۹. صفحات جدید هنوز فرصت کافی برای Crawl شدن نداشتهاند
گاهی واقعاً هیچ مشکلی وجود ندارد!
صفحهای که همین امروز منتشر شده، لزوماً همان روز توسط گوگل Crawl و Index نمیشود. گوگل اعلام کرده که برای بسیاری از سایتها مشاهده و پردازش صفحات جدید میتواند چند روز یا بیشتر زمان ببرد.
بنابراین اگر مقالهای تازه منتشر شده است، ابتدا باید زمان انتشار، وضعیت Crawl و اعتبار کلی سایت را در نظر گرفت.
۱۰. سرعت پایین یا ناپایداری سایت
سرعت پایین به تنهایی به این معنی نیست که صفحه ایندکس نمیشود، اما مشکلات شدید عملکردی، پاسخگویی کند سرور یا قطعیهای مکرر میتوانند توانایی Googlebot برای Crawl سایت را کاهش دهند.
گوگل در راهنمای Crawl خود تأکید میکند که سرعت پاسخ سرور و مشکلات مربوط به Availability میتوانند روی فرآیند Crawl تأثیر بگذارند.
بنابراین اگر سایت در ساعات مختلف با کندی، Timeout یا خطا مواجه میشود، بررسی وضعیت هاست و سرور نیز بخشی از فرآیند عیبیابی Indexing است.
چگونه بفهمیم دقیقاً چرا یک صفحه ایندکس نشده است؟
بهترین ابزار برای بررسی یک URL مشخص، URL Inspection در Google Search Console است.
URL موردنظر را وارد کنید و موارد زیر را بررسی کنید:
- URL is on Google: آیا URL در گوگل وجود دارد یا خیر؟
- Crawl allowed: آیا Googlebot اجازه Crawl صفحه را دارد؟
- Indexing allowed: آیا noindex مانع ایندکس شدن شده است؟
- User-declared canonical: سایت چه URLای را به عنوان Canonical معرفی کرده است؟
- Google-selected canonical: گوگل کدام URL را به عنوان نسخه اصلی انتخاب کرده است؟
همچنین اگر نسخه فعلی صفحه تغییر کرده، میتوان از گزینه Test Live URL برای بررسی وضعیت فعلی استفاده کرد.
چکلیست فنی رفع مشکل Indexing
برای بررسی یک صفحه که ایندکس نشده، این ترتیب را پیشنهاد میکنم:
| بررسی | وضعیت مطلوب |
|---|---|
| HTTP Status | ۲۰۰ OK |
| Robots.txt | عدم Block شدن URL |
| Meta Robots | index, follow |
| X-Robots-Tag | عدم وجود noindex |
| Canonical | URL اصلی و صحیح |
| Sitemap | حضور URL مهم در Sitemap |
| Internal Links | وجود لینک داخلی Crawlable |
| محتوای صفحه | اختصاصی و ارزشمند |
| Duplicate Content | عدم وجود نسخههای مشابه مشکلساز |
| Server | پایدار و بدون خطاهای مکرر |
| Mobile Rendering | نمایش صحیح محتوا برای Googlebot |
| Search Console | بررسی Page Indexing و URL Inspection |
در نهایت باید به خاطر داشت که ایندکس شدن نتیجه یک عامل واحد نیست. گوگل ابتدا باید بتواند URL را پیدا و Crawl کند و سپس درباره Indexing آن تصمیم بگیرد. بنابراین اگر سایتی ایندکس نمیشود، بهترین رویکرد این است که به جای ارسال مکرر درخواست Indexing، ابتدا مشخص کنیم مشکل در Discovery، Crawling، Technical SEO یا خود Content قرار دارد.
منبع

