وقتی کسی از ChatGPT یا Perplexity سوالی میپرسد و آن ابزار چند منبع را معرفی میکند، اولین شرط حضور شما در آن فهرست این است که خزندهٔ همان سرویس اجازهٔ خواندن سایتتان را داشته باشد. این تصمیم در فایل robots.txt گرفته میشود و متاسفانه یکی از پرتکرارترین اشتباههای فنی امروز، بستن ناخواستهٔ همین در است. در این راهنما دقیقا میبینیم کدام خزنده چه کاری میکند، چه چیزی را باید باز بگذارید و ماجرای llms.txt چقدر واقعی است.
خزندههای هوش مصنوعی چه فرقی با خزندهٔ گوگل دارند؟
خزندهٔ سنتی مثل Googlebot محتوا را برای فهرست جستوجو میخواند، ولی خزندههای هوش مصنوعی سه کار متفاوت انجام میدهند: جمعآوری داده برای آموزش مدل، ساخت فهرست برای جستوجوی درونبرنامهای، و خواندن لحظهای یک صفحه وقتی کاربر مستقیما درخواست میکند. هر کدام user-agent جدا دارند و تصمیم شما برای هرکدام باید جدا باشد.
همین تفکیک، قلب ماجراست. خیلی از سایتها یک خط در robots.txt مینویسند تا «جلوی هوش مصنوعی را بگیرند» و بدون اینکه بدانند، خودشان را از فهرست منابع ChatGPT هم حذف میکنند. تصمیم درست این است که بدانید کدام در را میبندید.
جدول کامل خزندههای هوش مصنوعی و کاری که میکنند
پیش از هر تصمیمی باید بدانید هر نام دقیقا مسئول چیست؛ چون بستن یکی بیضرر است و بستن دیگری شما را از استناد در پاسخهای هوش مصنوعی حذف میکند. جدول زیر بر پایهٔ مستندات رسمی خود شرکتها تنظیم شده است.
| نام خزنده | متعلق به | کارش چیست | اگر ببندید چه میشود |
|---|---|---|---|
GPTBot | OpenAI | جمعآوری محتوا برای آموزش مدلهای پایه | محتوای شما برای آموزش استفاده نمیشود؛ روی دیدهشدن در ChatGPT اثری ندارد |
OAI-SearchBot | OpenAI | ساخت فهرست برای قابلیت جستوجوی ChatGPT | از نتایج جستوجوی ChatGPT حذف میشوید |
ChatGPT-User | OpenAI | خواندن یک صفحه وقتی کاربر مستقیما درخواست میکند | وقتی کاربری لینک شما را به ChatGPT بدهد، باز نمیشود |
OAI-AdsBot | OpenAI | بررسی صفحات فرود تبلیغات | ربطی به سئو ندارد |
Google-Extended | گوگل | کنترل استفاده از محتوا برای آموزش مدلهای Gemini | روی رتبهٔ جستوجوی گوگل و AI Overviews هیچ اثری ندارد |
ClaudeBot | Anthropic | جمعآوری محتوا برای آموزش | محتوا برای آموزش استفاده نمیشود |
PerplexityBot | Perplexity | فهرستسازی برای پاسخهای ارجاعدار | احتمال استناد شما در پاسخهای Perplexity کم میشود |
دو ردیف این جدول مهمترین سوءتفاهم رایج را حل میکنند. اول اینکه GPTBot و OAI-SearchBot دو چیز کاملا متفاوتاند: اولی آموزش مدل است و دومی دیدهشدن در جستوجوی ChatGPT. دوم اینکه گوگل صراحتا میگوید بستن Google-Extended نه بر حضور شما در جستوجو اثر دارد و نه سیگنال رتبهبندی است.
تصمیم درست چیست؟ سه سناریوی واقعی
هیچ پاسخ واحدی برای همهٔ سایتها وجود ندارد؛ تصمیم به مدل کسبوکار شما بستگی دارد. ولی برای اکثر کسبوکارهایی که هدفشان دیدهشدن و جذب مشتری است، پاسخ ساده است: خزندههای جستوجو را باز بگذارید و فقط دربارهٔ خزندههای آموزش تصمیم بگیرید.
- کسبوکار خدماتی یا فروشگاهی که دنبال مشتری است: همه را باز بگذارید. شما از دیدهشدن سود میبرید و محتوایتان دارایی محرمانه نیست. این حالت پیشفرض و توصیهشده برای اکثر سایتهاست.
- ناشر محتوا یا رسانهای که محتوا محصولش است: خزندههای آموزش (
GPTBot،ClaudeBot،Google-Extended) را ببندید ولی خزندههای جستوجو (OAI-SearchBot،PerplexityBot) را باز بگذارید تا همچنان به شما ارجاع داده شود. - سایتی با محتوای حساس یا اختصاصی: بستن کامل منطقی است، ولی بدانید که در عمل از فهرست منابع هوش مصنوعی حذف میشوید.
نمونهٔ عملی robots.txt برای بازگذاشتن مسیر ارجاع
اگر هدفتان جذب مشتری است، سادهترین و امنترین کار این است که هیچ دستور محدودکنندهای برای خزندههای هوش مصنوعی ننویسید. نبود دستور یعنی اجازه، و همین کافی است. اگر میخواهید فقط آموزش را ببندید ولی ارجاع را حفظ کنید، الگوی زیر را استفاده کنید.
# بستن خزندههای آموزش مدل
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# باز گذاشتن خزندههای جستوجو تا همچنان به شما ارجاع داده شود
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Sitemap: https://example.com/sitemap_index.xmlسه نکتهٔ اجرایی که نباید فراموش شوند. اول، نام خزندهها به بزرگی و کوچکی حروف حساس نیست ولی املای دقیق مهم است و یک حرف اشتباه یعنی دستور بیاثر. دوم، قواعد User-agent: * فقط وقتی روی یک خزنده اعمال میشوند که بلوک اختصاصی برای آن خزنده وجود نداشته باشد. سوم، بعد از هر تغییر حتما فایل را در مرورگر باز کنید و ببینید همان چیزی است که نوشتهاید؛ خیلی از افزونههای سئو فایل مجازی میسازند و تغییر دستی را نادیده میگیرند. اگر با ساختار این فایل آشنا نیستید، مقالهٔ کرال باجت منطق کلی خزش را توضیح داده است.
llms.txt چیست و آیا واقعا لازم است؟
llms.txt یک فایل مارکداون در ریشهٔ سایت است که فهرستی ساده و خوانا از مهمترین صفحات شما به مدلهای زبانی میدهد. ولی برخلاف چیزی که خیلی جاها گفته میشود، این یک استاندارد رسمی نیست. یک پیشنهاد جامعهمحور است که سپتامبر ۲۰۲۴ مطرح شد و تا امروز هیچ شرکت بزرگ هوش مصنوعی رسما اعلام نکرده که از آن استفاده میکند.
تفاوت مفهومیاش با robots.txt هم مهم است. robots.txt دربارهٔ اجازهٔ دسترسی است و خزندهها آن را میخوانند. llms.txt دربارهٔ راهنمایی محتوایی در لحظهٔ پاسخدهی است و هیچ سازوکار الزامآوری پشتش نیست. پس این دو جایگزین هم نیستند و llms.txt بههیچوجه نمیتواند جای تنظیم درست robots.txt را بگیرد.
توصیهٔ صادقانه: ساختن llms.txt هزینهٔ تقریبا صفر دارد و ضرری هم ندارد، پس اگر وقت اضافه دارید بسازید. ولی آن را در اولویت بالا نگذارید و انتظار جهش رتبه از آن نداشته باشید. اولویت واقعی شما باید کیفیت محتوا و باز بودن مسیر خزندههای جستوجو باشد.
اگر خواستید llms.txt بسازید، چطور بنویسید؟
ساختار llms.txt عمدا ساده است: یک تیتر اصلی با نام کسبوکار، یک توضیح کوتاه، و چند فهرست از مهمترین صفحات با یک جملهٔ توضیح برای هرکدام. فایل باید در ریشهٔ دامنه و با فرمت مارکداون در آدرس /llms.txt در دسترس باشد.
# نام کسبوکار شما
> یک جملهٔ کوتاه که توضیح میدهد این سایت چه کاری انجام میدهد و برای چه کسی مفید است.
## صفحات اصلی
- [خدمات](https://example.com/services/): فهرست خدمات و حوزهٔ کاری
- [تعرفه](https://example.com/pricing/): توضیح مدل قیمتگذاری
- [تماس](https://example.com/contact/): راههای ارتباط و آدرس
## راهنماهای مرجع
- [راهنمای شروع](https://example.com/blog/getting-started/): مسیر گامبهگام برای مبتدیها
- [پرسشهای پرتکرار](https://example.com/faq/): پاسخ کوتاه به سوالهای رایجسه توصیه برای اینکه این فایل واقعا مفید باشد. اول، فقط صفحاتی را بیاورید که واقعا نمایندهٔ کسبوکار شما هستند؛ فهرست بلند و بیکیفیت نتیجهٔ معکوس دارد. دوم، توضیح هر لینک را کوتاه و دقیق بنویسید چون همین توضیح است که به مدل میفهماند صفحه دربارهٔ چیست. سوم، فایل را مثل نقشهٔ سایت بهروز نگه دارید؛ فهرستی که به صفحات حذفشده اشاره میکند بدتر از نبودنش است.
آیا robots.txt واقعا رعایت میشود؟
robots.txt یک قرارداد داوطلبانه است، نه یک قفل فنی. خزندهٔ خوشرفتار آن را رعایت میکند و خزندهٔ بدرفتار میتواند نادیدهاش بگیرد. این تفاوت مهمی است که در بیشتر راهنماهای فارسی گفته نمیشود و باعث میشود کسبوکارها به یک محافظت خیالی دل ببندند.
نمونهٔ مستند این ماجرا مربوط به آگوست ۲۰۲۵ است؛ کلادفلر گزارشی منتشر کرد مبنی بر اینکه Perplexity از خزندههای اعلامنشده با چرخش user-agent و آیپی برای دور زدن دستورهای no-crawl استفاده کرده است. نتیجهٔ عملی این گزارش برای شما روشن است: اگر محتوایی واقعا نباید خوانده شود، تکیه بر robots.txt کافی نیست و باید سراغ احراز هویت، محدودسازی در سطح سرور یا سرویسهای محافظتی بروید.
چطور بفهمیم خزندههای هوش مصنوعی سایت ما را میخوانند؟
مطمئنترین راه، نگاهکردن به لاگ سرور است؛ چون هر بازدید خزنده با نام user-agent خودش آنجا ثبت میشود. ابزارهای تحلیلی معمولی مثل گوگل آنالیتیکس این بازدیدها را نشان نمیدهند، چون خزندهها جاوااسکریپت را اجرا نمیکنند.
- در پنل هاست، بخش لاگ دسترسی را باز کنید و دنبال نامهایی مثل
GPTBot،OAI-SearchBot،ClaudeBotوPerplexityBotبگردید. - اگر از سرویسهای محافظتی مثل کلادفلر استفاده میکنید، گزارش رباتها معمولا همین تفکیک را آماده نشان میدهد.
- روش ساده و غیرفنی: چند سوال مرتبط با کسبوکارتان را از ChatGPT و Perplexity بپرسید و ببینید آیا اصلا به سایت شما ارجاع داده میشود یا نه.
- رشد جستوجوی نام برند را در سرچ کنسول دنبال کنید؛ افزایش آن یکی از نشانههای غیرمستقیم دیدهشدن در پاسخهای هوش مصنوعی است. روش کار با این گزارش در آموزش گوگل سرچ کنسول توضیح داده شده است.
باز کردن مسیر کافی نیست؛ محتوا هم باید قابل نقل باشد
دسترسی خزنده شرط لازم است نه شرط کافی. وقتی در باز شد، انتخاب اینکه به کدام منبع ارجاع داده شود به کیفیت و ساختار محتوای شما برمیگردد. مدلهای زبانی معمولا یک پاراگراف مستقل را نقل میکنند، نه کل صفحه را.
پس بعد از تنظیم فنی، سراغ ساختار محتوا بروید: زیر هر تیتر یک پاسخ مستقیم و کوتاه بنویسید، آمار را با ذکر منبع بیاورید و هر بخش را طوری بنویسید که جدا از بقیهٔ صفحه هم کامل معنا بدهد. راهکارهای کامل این بخش در پیلار سئو در عصر هوش مصنوعی آمده است و اگر میخواهید بدانید خلاصههای هوش مصنوعی خود گوگل چطور منبع انتخاب میکنند، AI Overviews گوگل همان را جداگانه بررسی کرده است.
یک نکتهٔ عملی از بررسی خودمان: وقتی robots.txt همین سایت را بازبینی کردیم، هیچ دستور مربوط به خزندههای هوش مصنوعی در آن نبود، یعنی همهٔ آنها بهطور پیشفرض اجازهٔ دسترسی داشتند. برای یک سایت خدماتی این دقیقا وضعیت مطلوب است و نیازی به تغییر نداشت. این را میگوییم چون تصور رایج این است که «حتما باید کاری کرد»، در حالی که در بیشتر موارد بهترین کار دستنزدن است.
پنج اشتباه رایج در تنظیم دسترسی هوش مصنوعی
بیشتر آسیبها در این حوزه از تصمیمهای شتابزده میآید، نه از بیعملی. پنج مورد زیر رایجترین اشتباههایی است که در بازبینی سایتها دیده میشود.
- بستن همهٔ رباتهای هوش مصنوعی با یک دستور کلی. نتیجهاش حذفشدن از فهرست منابع ChatGPT و Perplexity است، در حالی که هدف اولیه فقط جلوگیری از آموزش بود.
- بستن
Google-Extendedبه این خیال که روی رتبه اثر دارد. گوگل صراحتا گفته این توکن نه بر حضور در جستوجو اثر دارد و نه سیگنال رتبهبندی است. - اعتماد کامل به robots.txt برای محافظت. این فایل یک درخواست است نه یک قفل؛ برای محتوای واقعا حساس باید از احراز هویت استفاده کرد.
- ساختن llms.txt و انتظار جهش رتبه. این فایل هنوز استاندارد پذیرفتهشدهای نیست و جای محتوای باکیفیت را نمیگیرد.
- تغییر robots.txt بدون تست. بعد از هر ویرایش، فایل را در مرورگر باز کنید؛ افزونههای سئو گاهی نسخهٔ مجازی خودشان را سرو میکنند و تغییر شما اصلا اعمال نمیشود.
اگر مطمئن نیستید وضعیت فعلی سایتتان چیست و کدام تنظیم برای مدل کسبوکار شما درست است، بررسی آن بخشی از خدمات سئو وب است که پیش از هر تغییری وضعیت موجود را مستند میکند.
جمعبندی
برای دیدهشدن در ChatGPT و Perplexity، اولین قدم فنی این است که مسیر خزندههای جستوجوی آنها باز باشد. کلید ماجرا تفکیک نقشهاست: خزندهٔ آموزش با خزندهٔ جستوجو فرق دارد و بستن اولی بیضرر است ولی بستن دومی شما را از فهرست منابع حذف میکند. برای اکثر کسبوکارهایی که دنبال مشتری هستند، بهترین تنظیم همان دستنزدن است. llms.txt را میتوانید بسازید ولی بهعنوان یک پیشنهاد غیررسمی به آن نگاه کنید نه راهحل جادویی، و یادتان باشد robots.txt یک قرارداد داوطلبانه است نه قفل. وقتی در باز شد، آنچه تعیین میکند به شما ارجاع داده شود یا نه، کیفیت و ساختار محتوای شماست.
سوالات متداول
برای دیدهشدن در ChatGPT باید کاری در robots.txt انجام دهم؟+
در بیشتر موارد خیر. اگر هیچ دستور محدودکنندهای ننوشته باشید، خزندهها بهطور پیشفرض اجازهٔ دسترسی دارند و همین کافی است. فقط مطمئن شوید OAI-SearchBot را بسته نباشید، چون همان مسئول حضور شما در جستوجوی ChatGPT است.
بستن GPTBot باعث میشود از ChatGPT حذف شویم؟+
خیر. GPTBot فقط مربوط به جمعآوری داده برای آموزش مدل است. حضور شما در قابلیت جستوجوی ChatGPT به OAI-SearchBot بستگی دارد که خزندهٔ جداگانهای است.
بستن Google-Extended به رتبهٔ ما در گوگل آسیب میزند؟+
خیر. گوگل در مستندات رسمی خود تصریح کرده که این توکن نه بر حضور سایت در جستوجوی گوگل اثر میگذارد و نه بهعنوان سیگنال رتبهبندی استفاده میشود. کارکردش فقط کنترل استفاده از محتوا برای آموزش مدلهای Gemini است.
llms.txt را حتما باید بسازم؟+
ضروری نیست. llms.txt یک پیشنهاد جامعهمحور از سپتامبر ۲۰۲۴ است و هیچ شرکت بزرگ هوش مصنوعی رسما اعلام نکرده که از آن استفاده میکند. ساختنش هزینهای ندارد ولی نباید انتظار اثر مستقیم بر رتبه داشته باشید.
اگر رباتها robots.txt را رعایت نکنند چه کنیم؟+
robots.txt یک قرارداد داوطلبانه است و ضمانت اجرایی ندارد. برای محتوایی که واقعا نباید خوانده شود باید از احراز هویت، محدودسازی در سطح سرور یا سرویسهای محافظت در برابر ربات استفاده کنید.
چطور بفهمم ChatGPT یا Perplexity سایتم را خواندهاند؟+
لاگ دسترسی سرور را ببینید و دنبال نام خزندههایی مثل OAI-SearchBot و PerplexityBot بگردید. گوگل آنالیتیکس این بازدیدها را نشان نمیدهد چون خزندهها جاوااسکریپت اجرا نمیکنند.
منابع




