Robots.txt چیست و چطور باید تنظیم شود؟

Robots.txt چیست و چطور باید تنظیم شود؟

فهرست مطالب

وقتی وارد دنیای سئو می‌شوید، خیلی زود با نام robots.txt روبه‌رو خواهید شد؛ فایلی کوچک اما بسیار مهم که می‌تواند مسیر خزیدن موتورهای جستجو در سایت شما را تعیین کند. در واقع، robots.txt مثل یک نگهبان ورودی عمل می‌کند و مشخص می‌کند ربات‌ها از کدام بخش‌ها عبور کنند و از کدام بخش‌ها دور بمانند. اگر این فایل را درست تنظیم کنید، بودجه خزش گوگل بهینه مصرف می‌شود و صفحات مهم سریع‌تر ایندکس می‌شوند. اما یک خطای کوچک می‌تواند باعث شود گوگل کل سایت شما را نبیند و ترافیکتان سقوط کند. تجربه من در پروژه‌های مختلف نشان داده است که تنظیم اشتباه این فایل ساده، یکی از رایج‌ترین دلایل افت شدید رتبه سایت‌هاست.

 

تعریف ساده و کاربرد

robots.txt یک فایل متنی بسیار ساده است که در روت سایت قرار می‌گیرد و به ربات‌های موتور جستجو اعلام می‌کند کدام مسیرها را می‌توانند بخزند و کدام‌ها را نباید لمس کنند. این فایل همیشه از طریق لینک زیر قابل مشاهده است:

yoursite.com/robots.txt

کارکرد اصلی آن مدیریت دسترسی خزنده‌ها است تا کنترل بیشتری روی فرآیند ایندکس داشته باشید.

 

تاریخچه کوتاه و دلیل ایجاد

اگر کمی به عقب برگردیم و به سال ۱۹۹۴ نگاه کنیم دورانی که اولین موتورهای جست‌وجو تازه متولد شده بودند می‌بینیم که بسیاری از مدیران وب‌سایت‌ها با یک دغدغه مشترک روبه‌رو بودند، ربات‌ها بدون هیچ محدودیتی وارد تمام بخش‌های سایت می‌شدند و هر صفحه‌ای را می‌خزیدند. این رفتار کنترل‌نشده می‌توانست برای سرورهای ضعیف آن زمان دردسرساز باشد و حتی باعث از کار افتادن سایت‌ها شود.

به‌بیان ساده، مدیران وب احساس می‌کردند باید راهی وجود داشته باشد تا بتوانند به ربات‌ها بگویند «کجا بروند و کجا نه». نتیجه این نگرانی و نیاز عملی، شکل‌گیری استانداردی به نام Robots Exclusion Protocol بود؛ پروتکلی که درواقع نسخه اولیه همان چیزی است که امروز آن را به‌عنوان فایل robots.txt می‌شناسیم.

این پروتکل ساده اما بسیار کاربردی، به مدیران سایت این امکان را داد که کنترل بیشتری بر مسیر حرکت ربات‌های جست‌وجو داشته باشند و از آن زمان تاکنون، همچنان یکی از پایه‌های اصلی سئو تکنیکال و مدیریت خزش سایت محسوب می‌شود.

 

ساختار فایل Robots txt

 

ساختار فایل Robots.txt

فایل Robots.txt در ظاهر بسیار ساده است، اما همین مجموعه کوچک از دستورها می‌تواند نقش تعیین‌کننده‌ای در نحوه خزش صفحات سایت شما داشته باشد. این فایل معمولاً از چند فرمان اصلی تشکیل شده که هرکدام به‌صورت مشخص به ربات‌های موتورهای جست‌وجو می‌گویند چه بخش‌هایی را بخزند و از کدام قسمت‌های سایت فاصله بگیرند.

 

User-agent:

این دستور مشخص می‌کند که مجموعه قوانین زیر آن برای کدام ربات اعمال می‌شود. برای مثال، اگر بخواهید تنها ربات گوگل را هدف قرار دهید، می‌توانید بنویسید:

User-agent: Googlebot

به بیان ساده، با این خط «مخاطب» قوانین خود را تعیین می‌کنید.

 

Disallow:

این دستور مسیرهایی را مشخص می‌کند که ربات‌ها نباید آن‌ها را بخزند. معمولاً از آن برای جلوگیری از دسترسی به بخش‌های مدیریتی یا پوشه‌های غیرضروری استفاده می‌شود. برای نمونه:

Disallow: /wp-admin/

یعنی ربات اجازه ندارد وارد پوشه مدیریت وردپرس شود.

 

Allow:

عدد در برابر Disallow، این دستور مسیرهایی را تعیین می‌کند که حتی اگر داخل یک پوشه مسدودشده باشند، همچنان اجازه خزش داشته باشند.

Allow: /wp-admin/admin-ajax.php

به‌عبارتی دیگر، شما یک استثنا تعریف می‌کنید و می‌گویید: «در این مسیر خاص، ورود آزاد است.»

در ظاهر، این دستورها ساده و کوتاه هستند؛ اما از آن‌جایی که کنترل مستقیم رفتار ربات‌ها را برعهده دارند، بسیار حساس هستند و کوچک‌ترین اشتباه در نگارش آن‌ها می‌تواند باعث مسدود شدن صفحات مهم یا ایندکس نشدن بخش‌هایی از سایت شود.

 

تفاوت Crawl-delay و Sitemap

در فایل robots.txt دو مفهوم وجود دارد که معمولاً کاربران تازه‌کار آن‌ها را با هم اشتباه می‌گیرند، اما در عمل نقش‌های کاملاً متفاوتی دارند و هرکدام هدف مشخصی را دنبال می‌کنند.

 

Crawl-delay:

این دستور فاصله زمانی میان هر درخواست ربات به سرور را مشخص می‌کند. به‌عبارتی دیگر، شما به ربات می‌گویید «بین هر بار خزش، کمی صبر کن تا روی سرور فشار نیاید». البته باید به این نکته مهم توجه کرد که همه موتورهای جست‌وجو از دستور Crawl-delay پشتیبانی نمی‌کنند؛ برای مثال، گوگل این فرمان را نادیده می‌گیرد و ترجیح می‌دهد کنترل نرخ خزش را براساس شرایط سرور و رفتار سایت شما به‌صورت خودکار مدیریت کند.

 

Sitemap:

در مقابل، دستور Sitemap یکی از مهم‌ترین استفاده‌های فایل robots.txt محسوب می‌شود. با این دستور، شما آدرس نقشه سایت (XML Sitemap) را به ربات‌ها معرفی می‌کنید تا بتوانند ساختار صفحات مهم را سریع‌تر و دقیق‌تر پیدا کنند. این یک سیگنال مثبت برای موتورهای جست‌وجو است و باعث می‌شود فرآیند کشف (Discovery) و ایندکس بهتر و سریع‌تر انجام شود.

نمونه استفاده از این دستور به شکل زیر است:

Sitemap: https://yoursite.com/sitemap.xml

به بیان ساده، Crawl-delay مربوط به سرعت خزش است، اما Sitemap مربوط به مسیر خزش. یکی کنترل می‌کند ربات چقدر سریع حرکت کند و دیگری مسیر درست را به او نشان می‌دهد.

 

خطاهای رایج

تنظیم فایل robots.txt ساده به نظر می‌رسد، اما در عمل اشتباهاتی در آن رخ می‌دهد که بیشتر از چیزی است که تصور می‌کنید. این خطاها گاهی آن‌قدر ظریف‌اند که تنها با یک علامت یا یک خطا در ساختار، می‌توانند بخش‌هایی از سایت را به‌طور کامل از دید گوگل پنهان کنند.

 

۱. نوشتن مسیر اشتباه

یکی از رایج‌ترین اشتباهات، وارد کردن مسیر نادرست است. برای مثال:

/wp-admin

به جای نسخه صحیح:

/wp-admin/

همین یک اسلش ساده می‌تواند باعث شود ربات رفتار متفاوتی داشته باشد و مسیر موردنظر شما را به‌طور کامل تشخیص ندهد.

 

۲. ایجاد چندین User-agent بدون نظم و ساختار

گاهی دیده می‌شود که مدیران سایت چندین User-agent را پشت‌سر هم می‌نویسند، اما هیچ نظم یا اولویتی در قوانین آن‌ها وجود ندارد. در چنین حالتی، ربات‌ها دقیقاً متوجه نمی‌شوند کدام قانون برای چه بخشی است و ممکن است قوانین نادرست یا متناقضی اجرا شود.

 

۳. حذف اتفاقی دستور Allow در وردپرس

در سایت‌های وردپرسی، بسیاری از کارها با افزونه‌ها انجام می‌شود و همین موضوع باعث می‌شود دستور Allow ـ که برای اجازه دسترسی به برخی فایل‌های ضروری استفاده می‌شود ـ گاهی به‌صورت اتفاقی حذف یا بازنویسی شود. حذف این دستور ممکن است باعث شود بخش مهمی از عملکردهای ajax یا فایل‌های سیستمی از دسترس ربات‌ها خارج شود و خزش سایت با مشکل روبه‌رو شود.

به‌طور کلی، فایل robots.txt با اینکه بسیار کوچک است، اما اثرگذاری بزرگی بر خزش سایت دارد. بنابراین تنها یک خط اشتباه می‌تواند روی سئو چندین صفحه یا حتی کل دامنه تأثیر بگذارد.

 

 

چرا باید robots.txt تنظیم کنیم؟

 

چرا باید robots.txt تنظیم کنیم؟

استفاده درست از فایل robots.txt درواقع یکی از پایه‌های مدیریت سئو تکنیکال است و کمک می‌کند ربات‌های موتورهای جست‌وجو با نظم و هدف‌مندی بیشتری سایت شما را بخزند. این فایل کوچک اما مهم، مزایای زیادی دارد که در ادامه مهم‌ترین آن‌ها را بررسی می‌کنیم.

 

۱. مدیریت بودجه خزش (Crawl Budget)

ربات‌های گوگل برای هر سایت زمان و منابع محدودی در نظر می‌گیرند؛ به‌عبارتی دیگر، گوگل یک سهمیه مشخص دارد که طی آن می‌تواند صفحات شما را بررسی کند. حالا اگر این سهمیه صرف صفحاتی شود که ارزش چندانی ندارند—مثل صفحات تکراری، تستی یا موارد کم‌اهمیت—صفحات مهم و حیاتی شما دیرتر دیده می‌شوند یا حتی ممکن است هرگز ایندکس نشوند. تنظیم درست robots.txt کمک می‌کند گوگل انرژی خود را بیشتر روی بخش‌هایی بگذارد که اهمیت واقعی دارند.

 

۲. جلوگیری از ایندکس صفحات بی‌ارزش

بسیاری از صفحات یک سایت لزوماً نباید وارد نتایج گوگل شوند. برای مثال، صفحات فیلترهای فروشگاهی، آرشیوهای تکراری در وردپرس یا آدرس‌های تستی، معمولاً محتوای مستقل و ارزشمندی ندارند و بهتر است از دید ربات‌ها دور بمانند. با استفاده از robots.txt می‌توانیم این مسیرها را مسدود کنیم و مطمئن شویم فقط صفحات مفید و هدفمند وارد فهرست ایندکس گوگل می‌شوند.

 

۳. افزایش امنیت و حفظ حریم خصوصی

اگرچه robots.txt یک ابزار امنیتی به معنای واقعی نیست، اما نقش مهمی در جلوگیری از خزش بخش‌هایی دارد که برای عموم کاربران طراحی نشده‌اند—مثل پنل مدیریت، فایل‌های سیستمی یا مسیرهای داخلی سایت. وقتی این بخش‌ها مسدود شوند، گوگل و دیگر ربات‌ها کمتر به سراغ قسمت‌هایی می‌روند که نباید خزش شوند، و این موضوع در مجموع به حفظ ساختار سایت و کاهش ریسک‌های احتمالی کمک می‌کند.

به‌طور خلاصه، تنظیم درست فایل robots.txt نه‌تنها باعث افزایش کارایی ربات‌های گوگل می‌شود، بلکه کمک می‌کند سایت شما تمیزتر، هدفمندتر و ایمن‌تر خزیده شود.

 

چطور فایل Robots.txt بسازیم؟

ساخت فایل Robots.txt برخلاف تصور بسیاری از افراد، کار پیچیده‌ای نیست. شما می‌توانید تنها با یک ادیتور ساده، این فایل را بسازید و آن را در روت (Root) هاست خود قرار دهید تا موتورهای جست‌وجو به آن دسترسی داشته باشند. کافی است بدانید چه قوانینی باید داخل آن نوشته شود و جایگاه درست فایل کجاست.

 

ساخت دستی با Notepad یا هر ادیتور ساده

برای شروع، تنها کافی است یک فایل متنی جدید ایجاد کنید. این کار را می‌توانید با Notepad در ویندوز، TextEdit در مک یا هر ویرایشگر متنی دیگری انجام دهید. پس از ساخت فایل، آن را دقیقاً با نام زیر ذخیره کنید:

robots.txt

سپس این فایل باید در پوشه اصلی سایت (Root Directory) آپلود شود؛ همان جایی که فایل‌هایی مثل index.php قرار دارند. وقتی فایل در مسیر درست قرار بگیرد، آدرس آن معمولاً به شکل زیر خواهد بود:

https://example.com/robots.txt

 

نمونه استاندارد فایل Robots.txt

در ادامه یک نمونه فایل استاندارد را مشاهده می‌کنید که برای سایت‌های وردپرسی یا بسیاری از وب‌سایت‌های معمول کاملاً مناسب است:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap.xml

در این نمونه:

  • **User-agent: ***
    یعنی قوانین زیر برای همه ربات‌ها اعمال شود.

  • Disallow: /wp-admin/
    این مسیر مدیریتی وردپرس اجازه خزش ندارد.

  • Allow: /wp-admin/admin-ajax.php
    اما این فایل خاص باید قابل‌دسترسی باشد، زیرا بسیاری از عملکردهای وردپرس به آن متکی هستند.

  • Sitemap:
    آدرس نقشه سایت معرفی می‌شود تا ربات‌ها سریع‌تر صفحات مهم را پیدا کنند.

به‌طور کلی، ساخت robots.txt ساده است، اما از آن‌جایی که هر دستور می‌تواند مستقیماً بر خزش سایت تأثیر بگذارد، توصیه می‌شود هنگام تنظیم آن دقت زیادی به خرج دهید.

 

ابزارهای آنلاین ساخت robots.txt

اگر ترجیح می‌دهید فایل robots.txt را به‌صورت دستی و خط‌به‌خط ننویسید، خبر خوب این است که ابزارهای آنلاین متعددی وجود دارند که این کار را بسیار ساده‌تر می‌کنند. این ابزارها معمولاً یک رابط کاربری ساده در اختیار شما قرار می‌دهند تا فقط با انتخاب پوشه‌ها و تنظیم گزینه‌های دلخواه، نسخه نهایی فایل را تولید و دانلود کنید.

دو ابزار معتبر و پرکاربرد در این زمینه عبارت‌اند از:

SEOptimer – Robots.txt Generator

این ابزار به شما امکان می‌دهد با انتخاب مسیرهای موردنظر و تعیین قوانین، فایل robots.txt شخصی‌سازی‌شده‌ای دریافت کنید. رابط کاربری آن بسیار ساده است و برای کاربران مبتدی نیز مناسب خواهد بود.

https://www.seoptimer.com/robots-txt-generator

 

TechnicalSEO – Robots.txt Tool

یکی از بهترین ابزارهای تخصصی سئو برای تولید فایل robots.txt به‌شکل استاندارد و سازگار با موتورهای جست‌وجو. این ابزار همچنین به شما هشدار می‌دهد که آیا قوانین واردشده ممکن است باعث مسدود شدن بخش‌های مهم سایت شوند یا خیر.

https://technicalseo.com/tools/robots-txt/

در نهایت، کافی است پوشه‌هایی را که می‌خواهید مسدود یا در دسترس ربات‌ها قرار بگیرند انتخاب کنید و ابزار، نسخه نهایی فایل را در اختیار شما می‌گذارد. این روش برای بسیاری از افراد سریع‌تر، امن‌تر و کم‌خطاتر از ساخت دستی است.

 

نمونه‌های آماده برای سایت‌ وردپرسی

 

نمونه‌های آماده برای سایت‌ وردپرسی و فروشگاه ووکامرس

 

وردپرس

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml

فروشگاه ووکامرس

User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Allow: /wp-content/uploads/
Sitemap: https://example.com/sitemap_index.xml

 

ترفندهای حرفه‌ای در robots.txt

هرچند فایل robots.txt در ظاهر ساده است، اما می‌توان از آن برای کنترل‌های پیشرفته‌تر نیز استفاده کرد. در ادامه چند ترفند کاربردی و حرفه‌ای را بررسی می‌کنیم که به‌ویژه برای سایت‌های وردپرسی یا سایت‌هایی با ساختار محتوایی گسترده بسیار مفید هستند.

 

بستن بخش‌های تکراری وردپرس

در سایت‌های وردپرسی، بخش‌هایی مانند برچسب‌ها و دسته‌بندی‌ها گاهی محتوای تکراری یا کم‌ارزش تولید می‌کنند و ممکن است باعث هدررفت بودجه خزش شوند. با استفاده از دستورات زیر می‌توانید از خزش این صفحات جلوگیری کنید:

Disallow: /tag/
Disallow: /category/

این کار به ربات‌ها کمک می‌کند انرژی خود را بیشتر روی صفحات اصلی و ارزشمند متمرکز کنند.

 

جلوگیری از ایندکس پارامترهای UTM

لینک‌هایی که دارای پارامترهای UTM هستند معمولاً همان محتوای اصلی را تکرار می‌کنند و ایندکس شدن آن‌ها می‌تواند باعث ایجاد صفحات تکراری شود. برای جلوگیری از خزش این آدرس‌ها کافی است از دستور زیر استفاده کنید:

Disallow: /*?utm_source=

به این ترتیب، گوگل نسخه‌های دارای پارامتر را نادیده می‌گیرد و تنها صفحه اصلی را می‌خزد.

 

تفاوت Robots.txt و Meta Robots

در این مرحله بد نیست به تفاوت مهمی اشاره کنیم که معمولاً بسیاری از کاربران آن را اشتباه می‌گیرند:

  • robots.txt → جلوگیری از خزش (Crawling)
    با این فایل مشخص می‌کنید ربات‌ها وارد چه بخش‌هایی نشوند یا در چه مسیرهایی حرکت نکنند.

  • meta robots → جلوگیری از ایندکس (Indexing)
    این تگ داخل خود صفحه قرار می‌گیرد و به ربات می‌گوید: «اگر وارد این صفحه شدی، آن را در نتایج جست‌وجو ثبت نکن.»

به‌عبارتی دیگر، ممکن است بخواهید صفحه‌ای قابل خزش باشد—مثلاً برای بررسی لینک‌ها—اما نمی‌خواهید در نتایج گوگل ظاهر شود. در چنین شرایطی، گاهی لازم است هر دو ابزار را با هم استفاده کنید تا کنترل کامل‌تری روی رفتار ربات‌ها داشته باشید.

 

تست و اعتبارسنجی robots.txt

پس از ساخت و تنظیم فایل robots.txt، مرحله بسیار مهمی وجود دارد که بسیاری از مدیران سایت آن را نادیده می‌گیرند: تست و اعتبارسنجی. بررسی این فایل کمک می‌کند مطمئن شوید قوانین شما درست تفسیر می‌شوند و هیچ مسیر مهمی به‌صورت ناخواسته مسدود نشده است.

 

ابزار تست در Google Search Console

گوگل در Search Console بخشی اختصاصی برای بررسی robots.txt ارائه کرده است. این ابزار به شما نشان می‌دهد که ربات‌های گوگل کدام URLها را می‌توانند بخزند و کدام مسیرها به‌واسطه قوانین شما مسدود شده‌اند.
این بخش برای رفع خطاها، شناسایی مشکلات احتمالی و اطمینان از اجرای صحیح قوانین یکی از بهترین ابزارهای موجود است؛ مخصوصاً برای سایت‌های بزرگ یا فروشگاهی که صفحات زیادی دارند.

 

بررسی خطاهای رایج

در هنگام اعتبارسنجی، چند خطای رایج وجود دارد که باید به آن‌ها توجه کنید:

  • استفاده اشتباه از کاراکترهای * یا $
    این نشانه‌ها برای تطبیق الگوها به‌کار می‌روند و استفاده نادرست از آن‌ها می‌تواند باعث مسدود شدن مسیرهای اشتباه شود.

  • فراموش کردن اسلش پایانی (/)
    نبودن اسلش در انتهای پوشه‌ها ایجاد تفاوت در الگو می‌کند و ممکن است نتیجه‌ای کاملاً متفاوت از آنچه انتظار دارید به همراه داشته باشد.

  • ننوشتن Sitemap در فایل
    اضافه نکردن آدرس نقشه سایت یکی از خطاهای رایج است که می‌تواند فرآیند کشف صفحات مهم را کند کند. معرفی Sitemap تقریباً همیشه توصیه می‌شود.

به‌طور کلی، تست فایل robots.txt پیش از انتشار نهایی، از بسیاری مشکلات آینده جلوگیری می‌کند و تضمین می‌کند که ربات‌ها در مسیر درست حرکت می‌کنند.

 

اشتباهات رایج در تنظیم robots.txt

اگرچه فایل robots.txt بسیار کوچک و ساده به‌نظر می‌رسد، اما یک خطای کوچک در آن می‌تواند تأثیر بزرگی بر کل سایت بگذارد. در ادامه چند مورد از خطرناک‌ترین اشتباهاتی را بررسی می‌کنیم که متأسفانه در بسیاری از سایت‌ها دیده می‌شود.

 

مسدود کردن کل سایت

بزرگ‌ترین و فاجعه‌بارترین اشتباه، استفاده از دستور زیر است:

User-agent: *
Disallow: /

این قانون به زبان ساده یعنی: «هیچ صفحه‌ای را نخز!»
به‌عبارتی دیگر، شما عملاً به گوگل دستور می‌دهید که هیچ بخشی از سایت را بررسی نکند. نتیجه این اشتباه، افت شدید رتبه، حذف صفحات از نتایج و از دست رفتن کامل ترافیک ارگانیک است. این خطا معمولاً زمانی رخ می‌دهد که نسخه آزمایشی سایت به محیط اصلی منتقل می‌شود و فایل robots.txt به‌درستی تغییر نمی‌کند.

 

بستن فایل‌های CSS و JS

برخی مدیران سایت به‌اشتباه فکر می‌کنند بستن فایل‌های CSS و JS بی‌اهمیت است، زیرا «محتوای اصلی صفحه» ایندکس می‌شود. اما واقعیت این است که گوگل برای ارزیابی تجربه کاربری، نیاز دارد صفحه را کامل رندر کند. اگر فایل‌های سبک مانند CSS یا اسکریپت‌های ضروری مسدود شوند، گوگل نمی‌تواند دید واقعی نسبت به ظاهر و عملکرد صفحه داشته باشد و این موضوع می‌تواند به افت رتبه یا دریافت هشدارهای مربوط به تجربه کاربری منجر شود.

 

فراموش کردن لینک Sitemap

اگرچه اضافه‌کردن Sitemap الزام صددرصدی نیست، اما نقش بسیار مهمی در هدایت ربات‌ها به صفحات کلیدی دارد. ننوشتن لینک Sitemap در robots.txt از رایج‌ترین اشتباهاتی است که باعث می‌شود فرآیند کشف و ایندکس صفحات مهم کندتر انجام شود. این خطا کوچک به‌نظر می‌رسد، اما تأثیر قابل‌توجهی بر سئوی سایت دارد.

 

نمونه واقعی از robots.txt برندهای بزرگ

 

نمونه واقعی از robots.txt برندهای بزرگ

 

دیجی‌کالا

دیجی‌کالا به‌دلیل ساختار بزرگ و پیچیده، مجموعه گسترده‌ای از مسیرها را برای جلوگیری از خزش مسدود کرده است. اکثر این مسیرها مربوط به صفحات شخصی‌سازی‌شده، فیلترها، مسیرهای داينامیک و بخش‌هایی هستند که ارزش محتوایی برای گوگل ندارند:

user-agent: *
disallow: /magnet/*
disallow: /users/*
disallow: /card
disallow: /shipping
disallow: /payment
disallow: *?*
disallow: /search?q=*
disallow: /profile*
disallow: *utm_*
disallow: /product/comment/*
...
Allow: */mag/*.js
Allow: */mag/*.css
Allow: *?x-oss-process=image/*
Sitemap: https://www.digikala.com/sitemap.xml
Sitemap: https://www.digikala.com/mag/sitemap_index.xml

همان‌طور که می‌بینید، دیجی‌کالا برای جلوگیری از هدررفت بودجه خزش، بیشتر مسیرهای پویا و پارامتردار را مسدود کرده و تنها فایل‌های ضروری مانند CSS و JS مجله را اجازه داده است.

دیوار

سایت دیوار نیز بخشی از مسیرهای خصوصی و صفحات جست‌وجوی پیچیده را محدود کرده است:

User-agent: *
Disallow: /my-divar/*
Disallow: /new
Disallow: /s/*/*?*q=*
Disallow: /adminbot

هدف، کاهش بار روی سرور و جلوگیری از ایندکس صفحات غیرضروری است.

ترب

ترب به‌عنوان یک موتور جست‌وجوی قیمت، مسیرهای جست‌وجوی داخلی را مسدود کرده و دسترسی برخی ربات‌ها مانند Ahrefs را به‌طور کامل بسته است:

User-agent: *
Disallow: /search/

User-agent: AhrefsBot
Disallow: /

Sitemap: https://torob.com/sitemap.xml

این کار نشان می‌دهد سایت‌هایی با ترافیک بالا ممکن است برای کاهش بار سرور، دسترسی برخی ربات‌ها را محدود کنند.

 

آپارات

آپارات به دلیل حجم بالای URLهای داینامیک و پارامتردار، یکی از سنگین‌ترین فایل‌های robots.txt را دارد. این فایل با دقت بسیار زیادی مسیرهای بی‌ارزش یا پردردسر را مسدود کرده است:

User-agent: *
Disallow: */curoffset
Disallow: */sort/a
Disallow: */sort/d
Disallow: *bufferlength=*
Disallow: *ei=*
Disallow: *goto=*
...
Allow: /video/video/embed/
Sitemap: https://www.aparat.com/sitemap.xml

هدف اصلی: جلوگیری از ایندکس نسخه‌های متعدد و پارامترهای فراوان صفحات ویدیو.

 

کافه‌بازار

کافه‌بازار بیشتر مسیرهای API، دانلود و صفحات لاگین را مسدود کرده است:

User-agent: *
Disallow: /download/*
Disallow: /json/*
Disallow: /api/*
Disallow: /s?q=*
Disallow: /video/s?q=*
Disallow: /login
Disallow: /signin?*
Allow: /signin?l=en

مسیری که نیاز نیست ایندکس شود، بهتر است خزش نشود.

 

فیلیمو

فیلیمو، مشابه آپارات، حجم زیادی از URLهای جلسه‌ای و پارامتردار را مسدود می‌کند تا از هدررفت بودجه خزش جلوگیری کند:

User-agent: *
Disallow: */curoffset
Disallow: */sort/a
Disallow: */sort/d
Disallow: *bufferlength=*
...
Disallow: */search/*
Allow: /etc/api
Disallow: /signin?afterlogin

فایل‌های حساس و مسیرهای متعدد که ارزش سئویی ندارند، به‌طور کامل مسدود شده‌اند.

 

زومیت

زومیت نیز برای جلوگیری از ایندکس نسخه‌های متعدد صفحات و اسکریپت‌ها، مجموعه بزرگی از مسیرها را بسته است:

User-agent: *
Disallow: */search/*
Disallow: */?*
Disallow: */catalog/product/count/*
Disallow: */getpricetrends/*
Disallow: /comment
Disallow: */api/*
Disallow: /*.json$
Disallow: /*_buildManifest.js$
...
Sitemap: https://www.zoomit.ir/sitemap.xml
Sitemap: https://www.zoomit.ir/sitemap/google-news.xml

این کار باعث می‌شود گوگل تنها نسخه اصلی صفحات را بخزد و ایندکس کند.

 

آمازون

فایل robots.txt آمازون یکی از پیچیده‌ترین و بزرگ‌ترین نمونه‌های موجود در سطح وب است؛ دلیل آن هم روشن است: آمازون میلیون‌ها صفحه پویا، حساب کاربری، مسیرهای خرید، ابزارهای داخلی، صفحات شخصی‌سازی‌شده و سرویس‌های زیرمجموعه دارد. بنابراین طبیعی است که مدیریت درست خزش برای این حجم عظیم داده، نیازمند مجموعه‌ای از قوانین بسیار دقیق باشد.

آمازون با استفاده از صدها دستور Disallow مشخص کرده است که ربات‌ها نباید چه بخش‌هایی از سایت را بخزند؛ بخش‌هایی که یا محتوای غیرثابت دارند، یا مخصوص فعالیت کاربران هستند، یا هیچ ارزش سئویی و محتوایی برای ایندکس شدن ندارند. این کار باعث می‌شود بودجه خزش ربات‌ها فقط برای صفحات مهم—مانند صفحات محصول، دسته‌بندی‌ها و محتوای عمومی—صرف شود.

در زیر، بخشی از مهم‌ترین بخش‌های فایل واقعی robots.txt آمازون را مشاهده می‌کنید:

User-agent: *
Disallow: /exec/obidos/account-access-login
Disallow: /exec/obidos/change-style
Disallow: /exec/obidos/flex-sign-in
Disallow: /exec/obidos/handle-buy-box
Disallow: /exec/obidos/tg/cm/member/
Disallow: /gp/cart
Disallow: /gp/sign-in
Disallow: /gp/reader
Disallow: /gp/gfix
Disallow: /gp/dmusic/order
Disallow: /gp/yourstore
Disallow: /gp/vote
Disallow: /gp/customer-images
Disallow: /gp/history
Disallow: /dp/shipping/
Disallow: /dp/e-mail-friend/
Disallow: /product-reviews/B0069IY63Y
Disallow: /gp/redirect.html
Disallow: */gcrnsts
Disallow: /lm/R1XIHQVKXSKBNJ
Disallow: /surprise/
Disallow: /local/ajax/
Disallow: /reviews/iframe
Disallow: /gp/video/*
Disallow: /giveaway/host/setup/
Allow: /wishlist/universal*
Allow: /gp/wishlist/universal*
Allow: /gp/dmusic/promotions/PrimeMusic
Allow: /-/es/
Allow: /-/en$

و این فقط یک بخش کوچک از فایل عظیم آمازون است.
فایل کامل شامل صدها خط دستور است که رفتار صدها سرویس و زیرسیستم آمازون را کنترل می‌کند.

 

محدود کردن ربات‌های هوش مصنوعی توسط آمازون

نکته جالب دیگر این است که آمازون به‌طور واضح و صریح، دسترسی بسیاری از ربات‌های هوش مصنوعی و سیستم‌های خزش داده را کاملاً مسدود کرده است.
این ربات‌ها شامل ChatGPT، GPTBot، ClaudeBot، PerplexityBot، Meta bots، Scrapy، Semrush bots و ده‌ها crawler دیگر هستند.

نمونه:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

این نشان می‌دهد آمازون به‌طور جدی از داده‌های خود محافظت می‌کند و مانع از اینکه مدل‌های هوش مصنوعی داده‌های سایتش را جمع‌آوری کنند می‌شود.

 

چرا این همه مسیر مسدود شده؟

وقتی فایل robots.txt آمازون را بررسی می‌کنیم، در نگاه اول حجم زیاد مسیرهای مسدود شده شاید عجیب به‌نظر برسد. اما با کمی دقت بیشتر متوجه می‌شویم که پشت هرکدام از این قوانین، یک منطق دقیق و یک ضرورت جدی وجود دارد. آمازون به‌عنوان یکی از بزرگ‌ترین وب‌سایت‌های دنیا، باید با دقت تعیین کند ربات‌ها اجازه دارند کجا بروند و از کدام بخش‌ها دور بمانند. دلایل اصلی این حجم از محدودیت را می‌توان در چند بخش خلاصه کرد:

 

۱. حفاظت از داده‌های حساس و مسیرهای حساب کاربری

بخش‌هایی مانند صفحه ورود، پروفایل کاربر، تاریخچه سفارش‌ها، سبد خرید و تنظیمات حساب جزو مسیرهایی هستند که فقط برای کاربران واقعی طراحی شده‌اند. خزش این بخش‌ها نه‌تنها هیچ ارزشی از نظر سئو ندارد، بلکه می‌تواند ریسک امنیتی نیز ایجاد کند. به همین دلیل، آمازون این مسیرها را کاملاً مسدود کرده تا ربات‌ها حتی به آن نزدیک هم نشوند.

 

۲. جلوگیری از هدررفت بودجه خزش (Crawl Budget)

سایت‌هایی با میلیون‌ها صفحه، بیش از هر چیز باید مراقب بودجه خزش خود باشند. آمازون میلیون‌ها URL پویا دارد که براساس موقعیت کاربر، حساب، آدرس و شرایط دیگر تغییر می‌کنند. ایندکس کردن این صفحات نه ارزش دارد، نه ضرورت. بنابراین بهترین راه این است که جلوی خزش آن‌ها گرفته شود تا ربات‌ها وقت خود را روی صفحات باارزش‌تری مانند محصولات، دسته‌بندی‌ها و راهنماهای خرید بگذارند.

 

۳. مقابله با صفحات تکراری و پارامترهای متعدد

ساختار URLهای آمازون سرشار از پارامترهایی مثل session، tracking، personalization و فیلترهای مختلف است. وجود این پارامترها می‌تواند به‌راحتی هزاران نسخه تکراری از یک صفحه تولید کند. برای همین، آمازون مجموعه بزرگی از قوانین Disallow را به مسیرهای پارامتری اختصاص داده تا از ایجاد صفحات Duplicate جلوگیری شود و بودجه خزش هدر نرود.

 

۴. کنترل بخش‌های داخلی، APIها و سرویس‌های زیرمجموعه

آمازون تنها یک فروشگاه آنلاین نیست؛ بلکه مجموعه‌ای از سرویس‌های گسترده مانند پخش ویدیو، موسیقی، بخش نقد و بررسی، سیستم رای‌گیری، برنامه‌های وابسته، گروه‌ها، ابزارهای داخلی و ده‌ها زیرساخت دیگر است. بسیاری از این سرویس‌ها URLهای داخلی، APIها و مسیرهایی دارند که مخصوص عملکرد سیستم هستند و هیچ نیازی به ایندکس شدن ندارند. آمازون با بستن این مسیرها از فشار غیرضروری روی سرور جلوگیری می‌کند.

 

۵. محدودیت شدید برای ربات‌های هوش مصنوعی

یکی از قابل‌توجه‌ترین نکات در robots.txt آمازون، مسدودسازی تقریبا کامل ربات‌های هوش مصنوعی و crawlerهای مرتبط با LLMهاست. آمازون ده‌ها ربات—از GPTBot و ClaudeBot گرفته تا PerplexityBot، Meta bots، Scrapy و ده‌ها خزنده دیگر—را مسدود کرده است.
این اقدام نشان می‌دهد آمازون به‌شدت نسبت به استخراج داده‌های خود حساس است و نمی‌خواهد مدل‌های هوش مصنوعی از محتوای سایت برای آموزش یا تحلیل استفاده کنند. در میان برندهای بزرگ جهانی، این میزان محدودیت کاملاً قابل‌توجه و تقریباً بی‌رقیب است.

 

جمع‌بندی

robots.txt فایل کوچک اما فوق‌العاده اثرگذار در سئو تکنیکال است. این فایل بودجه خزش را مدیریت می‌کند، از ایندکس شدن صفحات بی‌ارزش جلوگیری می‌کند و نقش مهمی در بهبود ساختار سایت دارد. اما همان‌قدر که مهم است، حساس نیز هست؛ یک خطای تایپی می‌تواند کل سایت را از نتایج حذف کند. پس همیشه با دقت آن را تنظیم کنید و از ابزارهای تست گوگل کمک بگیرید.

 

کلام آخر

اگر حس می‌کنی سایتت آن‌طور که باید در نتایج گوگل دیده نمی‌شود، یا نمی‌دانی مشکلات اصلی در خزش، ایندکس، ساختار صفحات یا حتی محتوایت کجاست، وقتش رسیده یک نگاه حرفه‌ای به وضعیت سئوی سایتت بیندازی.
من سینا رنجبر، متخصص سئو و موسس گلدن رشد، می‌توانم با یک مشاوره تخصصی سئو، سایتت را از نظر فنی، محتوایی و استراتژیک بررسی کنم و مسیر واقعی رشد ارگانیک را به تو نشان دهم.

گاهی فقط یک تحلیل درست و یک تصمیم هوشمندانه می‌تواند سرعت پیشرفت سایتت را چند برابر کند و کاری کند در نتایج گوگل همان جایی قرار بگیری که باید باشی.

اگر آماده‌ای قدم بعدی را برداری، من کنار تو هستم تا مسیر درست را نشان بدهم.

اشتراک گزاری:
sinaranjbarSEO
نوشته شده توسط

موسس آژانس سئو گلدن رشد هستم. سال‌هاست که به‌طور تخصصی در حوزه‌ی بهینه‌سازی موتورهای جستجو فعالیت می‌کنم.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *