گروه نرم افزاری چابک > طراحی و توسعه > چرا سایت در گوگل ایندکس نمی‌شود؟ بررسی فنی مشکلات Indexing
چرا سایت در گوگل ایندکس نمی‌شود؟ بررسی فنی مشکلات Indexing

ایندکس شدن در گوگل یکی از اولین مراحل دیده‌شدن یک سایت در نتایج جستجو است؛ اما صرفاً قرار دادن یک صفحه روی سایت یا ارسال Sitemap به Google Search Console به این معنی نیست که صفحه حتماً وارد ایندکس گوگل می‌شود. گوگل ابتدا باید بتواند صفحه را پیدا و Crawl کند، به آن دسترسی داشته باشد و سپس تشخیص دهد که صفحه شرایط لازم برای قرار گرفتن در نتایج جستجو را دارد. خود گوگل نیز تأکید می‌کند که حتی رعایت الزامات فنی، ایندکس شدن را تضمین نمی‌کند.

در نتیجه، وقتی یک صفحه در گوگل نمایش داده نمی‌شود، نباید بلافاصله مشکل را به Sitemap یا Search Console نسبت داد. برای پیدا کردن علت واقعی، باید مسیر Discovery → Crawling → Indexing را مرحله‌به‌مرحله بررسی کرد.

تفاوت Crawl و Index چیست؟

قبل از بررسی مشکلات، باید دو مفهوم مهم را از یکدیگر جدا کنیم.

Crawling یعنی Googlebot صفحه را پیدا کرده و محتوای آن را بررسی می‌کند. Indexing مرحله‌ای بعد از آن است که گوگل درباره نگهداری صفحه در فهرست صفحات قابل نمایش خود تصمیم می‌گیرد.

بنابراین ممکن است گوگل یک صفحه را Crawl کرده باشد اما آن را Index نکرده باشد. برای مثال، در Search Console ممکن است با وضعیت Crawled – currently not indexed مواجه شوید. از طرف دیگر، ممکن است گوگل هنوز صفحه را Crawl نکرده باشد و وضعیت‌هایی مانند Discovered – currently not indexed مشاهده شود. این دو وضعیت علت و راهکار یکسانی ندارند.

۱. وجود تگ Noindex

یکی از ساده‌ترین اما مهم‌ترین دلایل ایندکس نشدن صفحات، وجود دستور noindex است.

این دستور می‌تواند در HTML صفحه به شکل زیر قرار گرفته باشد:

<meta name="robots" content="noindex">

یا از طریق هدر HTTP با X-Robots-Tag ارسال شود. وقتی Googlebot بتواند این دستور را ببیند، صفحه را از نتایج جستجو حذف می‌کند.

این مشکل در سایت‌های وردپرسی گاهی به دلیل تنظیمات افزونه‌های SEO یا فعال بودن گزینه جلوگیری از نمایش سایت در موتورهای جستجو ایجاد می‌شود.

بنابراین برای صفحاتی که قرار است در گوگل رتبه بگیرند، باید وضعیت Index / Follow و تنظیمات مربوط به Robots بررسی شود.

بنابراین یا هیچ تگی وجود نداشته باشد (رویکرد گوگل برای صفحاتی که هیچ تگی ندارند یا از طریق تنظمیات Robots دسترسی ربات ها مسدود نشده باشند crawl کردن و ایندکس صفحه است) یا برای اطمینان میتوان از تگ زیر استفاده کرد:

<meta name="robots" content="index, follow">

۲. مسدود شدن صفحه در Robots.txt

فایل robots.txt مشخص می‌کند Googlebot اجازه دسترسی به چه بخش‌هایی از سایت را دارد.

برای مثال:

User-agent: *
Disallow: /blog/

می‌تواند دسترسی خزنده‌ها به مسیر /blog/ را محدود کند.

نکته مهم این است که robots.txt با noindex یکسان نیست. Robots.txt در درجه اول دسترسی خزنده به URL را کنترل می‌کند، در حالی که noindex مستقیماً به موتور جستجو می‌گوید صفحه را در نتایج جستجو قرار ندهد. گوگل توصیه می‌کند برای جلوگیری از ایندکس یک صفحه، از noindex استفاده شود و صفحه برای Googlebot قابل Crawl باشد.

۳. مشکل Canonical

Canonical یکی از موارد مهم در تشخیص URL اصلی صفحات مشابه است.

فرض کنید یک صفحه با این آدرس وجود دارد:

example.com/product/a

اما در کد صفحه Canonical به این URL اشاره می‌کند:

<link rel="canonical" href="https://example.com/product/b">

در این شرایط به گوگل اعلام شده که نسخه اصلی صفحه B است و صفحه A نسخه جایگزین محسوب می‌شود.

حتی اگر Canonical را درست تنظیم کرده باشید، گوگل الزاماً Canonical اعلام‌شده توسط سایت را انتخاب نمی‌کند و ممکن است خودش URL دیگری را به عنوان نسخه اصلی انتخاب کند. این موضوع را می‌توان در URL Inspection در بخش User-declared canonical و Google-selected canonical بررسی کرد.

۴. مشکل Sitemap

Sitemap به گوگل کمک می‌کند URLهای مهم سایت را پیدا کند؛ اما یک تصور اشتباه رایج این است که:

«اگر URL را در Sitemap قرار بدهم، حتماً ایندکس می‌شود.»

چنین تضمینی وجود ندارد.

Sitemap بیشتر یک سیگنال برای کشف URLهاست و به تنهایی باعث ایندکس شدن صفحه یا افزایش رتبه آن نمی‌شود.

بنابراین Sitemap باید شامل URLهای قابل ایندکس، اصلی و ارزشمند سایت باشد، نه صفحات تکراری، فیلترها، صفحات بی‌ارزش یا URLهایی که قرار نیست در نتایج گوگل دیده شوند.

۵. صفحه هیچ لینک داخلی مناسبی ندارد

گوگل باید بتواند صفحات سایت را پیدا کند.

اگر یک مقاله فقط در Sitemap وجود داشته باشد اما هیچ لینک داخلی مناسبی از صفحات دیگر سایت به آن وجود نداشته باشد، کشف آن می‌تواند دشوارتر شود.

به همین دلیل بهتر است مقالات جدید از بخش‌هایی مانند:

  • صفحه اصلی
  • صفحه بلاگ
  • مقالات مرتبط
  • دسته‌بندی‌ها
  • صفحات خدمات
  • مقالات قدیمی مرتبط

لینک دریافت کنند.

گوگل نیز استفاده از لینک‌های استاندارد و Crawlable را برای کمک به کشف URLها توصیه می‌کند.

۶. خطای HTTP یا مشکلات سرور

اگر Googlebot هنگام مراجعه به صفحه با خطاهایی مانند:

۴۰۴ Not Found
۴۰۳ Forbidden
۵۰۰ Internal Server Error
۵۰۲ Bad Gateway
۵۰۳ Service Unavailable
۵۰۴ Gateway Timeout

مواجه شود، فرآیند Crawl و Indexing دچار مشکل خواهد شد.

طبق الزامات فنی گوگل، صفحه‌ای که قرار است ایندکس شود باید برای Googlebot قابل دسترسی باشد و پاسخ موفقیت‌آمیز HTTP، معمولاً ۲۰۰ OK، ارائه کند.

به همین دلیل اگر سایت گاهی با ۵۰۴ یا خطاهای سرور مواجه می‌شود، بررسی این موضوع در کنار Search Console و لاگ‌های سرور اهمیت زیادی دارد.

۷. صفحه توسط گوگل Crawl شده اما ارزش کافی برای Indexing ندارد

این یکی از مهم‌ترین بخش‌های مسئله است.

گاهی هیچ مشکل فنی جدی وجود ندارد؛ Googlebot صفحه را باز کرده، محتوا را خوانده اما صفحه را وارد ایندکس نکرده است.

در Search Console ممکن است چنین صفحه‌ای با وضعیت:

Crawled – currently not indexed

نمایش داده شود.

در این شرایط باید خود محتوا بررسی شود:

  1. آیا محتوا واقعاً اطلاعات جدیدی ارائه می‌کند؟
  2. آیا با مقاله دیگری در سایت تفاوت معناداری دارد؟
  3. آیا صفحه بیش از حد کوتاه و سطحی است؟
  4. آیا بخش زیادی از آن از منابع دیگر تکرار شده است؟
  5. آیا صفحه برای کاربر ارزش مشخصی ایجاد می‌کند؟

در چنین شرایطی، صرفاً درخواست Indexing مجدد لزوماً مشکل را حل نمی‌کند.

۸. محتوای تکراری

Duplicate Content نیز می‌تواند باعث شود گوگل به جای چند URL مشابه، یک نسخه را به عنوان URL اصلی انتخاب کند.

برای مثال ممکن است یک مقاله از چند URL مختلف قابل دسترسی باشد:

/article/example
/article/example/
/?post=123
/category/example/article/example

اگر سایت به‌درستی URLهای اصلی را مدیریت نکند، گوگل باید بین نسخه‌های مشابه تصمیم بگیرد.

Canonical، Redirect، ساختار URL و لینک‌های داخلی باید در کنار یکدیگر بررسی شوند.

۹. صفحات جدید هنوز فرصت کافی برای Crawl شدن نداشته‌اند

گاهی واقعاً هیچ مشکلی وجود ندارد!

صفحه‌ای که همین امروز منتشر شده، لزوماً همان روز توسط گوگل Crawl و Index نمی‌شود. گوگل اعلام کرده که برای بسیاری از سایت‌ها مشاهده و پردازش صفحات جدید می‌تواند چند روز یا بیشتر زمان ببرد.

بنابراین اگر مقاله‌ای تازه منتشر شده است، ابتدا باید زمان انتشار، وضعیت Crawl و اعتبار کلی سایت را در نظر گرفت.

۱۰. سرعت پایین یا ناپایداری سایت

سرعت پایین به تنهایی به این معنی نیست که صفحه ایندکس نمی‌شود، اما مشکلات شدید عملکردی، پاسخ‌گویی کند سرور یا قطعی‌های مکرر می‌توانند توانایی Googlebot برای Crawl سایت را کاهش دهند.

گوگل در راهنمای Crawl خود تأکید می‌کند که سرعت پاسخ سرور و مشکلات مربوط به Availability می‌توانند روی فرآیند Crawl تأثیر بگذارند.

بنابراین اگر سایت در ساعات مختلف با کندی، Timeout یا خطا مواجه می‌شود، بررسی وضعیت هاست و سرور نیز بخشی از فرآیند عیب‌یابی Indexing است.

چگونه بفهمیم دقیقاً چرا یک صفحه ایندکس نشده است؟

بهترین ابزار برای بررسی یک URL مشخص، URL Inspection در Google Search Console است.

URL موردنظر را وارد کنید و موارد زیر را بررسی کنید:

  • URL is on Google: آیا URL در گوگل وجود دارد یا خیر؟
  • Crawl allowed: آیا Googlebot اجازه Crawl صفحه را دارد؟
  • Indexing allowed: آیا noindex مانع ایندکس شدن شده است؟
  • User-declared canonical: سایت چه URLای را به عنوان Canonical معرفی کرده است؟
  • Google-selected canonical: گوگل کدام URL را به عنوان نسخه اصلی انتخاب کرده است؟

همچنین اگر نسخه فعلی صفحه تغییر کرده، می‌توان از گزینه Test Live URL برای بررسی وضعیت فعلی استفاده کرد.

چک‌لیست فنی رفع مشکل Indexing

برای بررسی یک صفحه که ایندکس نشده، این ترتیب را پیشنهاد می‌کنم:

بررسیوضعیت مطلوب
HTTP Status۲۰۰ OK
Robots.txtعدم Block شدن URL
Meta Robotsindex, follow
X-Robots-Tagعدم وجود noindex
CanonicalURL اصلی و صحیح
Sitemapحضور URL مهم در Sitemap
Internal Linksوجود لینک داخلی Crawlable
محتوای صفحهاختصاصی و ارزشمند
Duplicate Contentعدم وجود نسخه‌های مشابه مشکل‌ساز
Serverپایدار و بدون خطاهای مکرر
Mobile Renderingنمایش صحیح محتوا برای Googlebot
Search Consoleبررسی Page Indexing و URL Inspection

در نهایت باید به خاطر داشت که ایندکس شدن نتیجه یک عامل واحد نیست. گوگل ابتدا باید بتواند URL را پیدا و Crawl کند و سپس درباره Indexing آن تصمیم بگیرد. بنابراین اگر سایتی ایندکس نمی‌شود، بهترین رویکرد این است که به جای ارسال مکرر درخواست Indexing، ابتدا مشخص کنیم مشکل در Discovery، Crawling، Technical SEO یا خود Content قرار دارد.

منبع

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *