llms.txt و مدیریت خزندههای AI: استراتژی دسترسی
چارچوبی برای تصمیم درباره اینکه چه چیزی را به خزندههای AI باز کنید: تفکیک باتهای آموزش، جستوجو و کاربر در robots.txt، جای واقعی llms.txt و بررسی لاگ.
نوشته Roozbeh Nazari · CEO
بخش قابلتوجهی از باتهایی که امروز از سایت شما بازدید میکنند دیگر موتور جستوجو نیستند. سه خانواده متفاوت از باتها وجود دارد: آنهایی که برای آموزش مدل محتوا جمع میکنند، آنهایی که برای نتایج جستوجوی AI ایندکس میسازند و آنهایی که وقتی کاربری سؤال میپرسد صفحه را لحظهای میگیرند. همه همان فایل robots.txt را میخوانند، اما چیزی که هرکدام به سایت شما میدهد و از آن میگیرد متفاوت است. این مقاله توضیح میدهد چطور تصمیم بگیرید چه چیزی را به کدام بات باز کنید و llms.txt کجای این تصمیم میایستد.
استراتژی دسترسی اولین گام کار مرئی بودن در جستوجوی هوش مصنوعی است؛ بدون اینکه بدانید کدام بات صفحه شما را نمیبیند، نمیتوانید تفسیر کنید در کدام پاسخ ظاهر نمیشوید. سمت محتوایی مرئی بودن، یعنی اینکه یک پاراگراف چطور قابل استناد میشود، را در مقاله قابلیت استناد پاراگراف گفتهایم.
سه خانواده بات، سه تصمیم جدا
مستندات ارائهدهندگان بزرگ خودشان این تفکیک را انجام میدهند. OpenAI سه عامل کاربر اصلی تعریف میکند: GPTBot برای آموزش مدل میخزد، OAI-SearchBot برای قابلیت جستوجوی ChatGPT ایندکس میسازد و ChatGPT-User با درخواست یک کاربر صفحه را میگیرد. Anthropic همین سهگانه را با نامهای ClaudeBot، Claude-SearchBot و Claude-User مستند میکند. در سمت Google، Google-Extended یک توکن محصول مستقل است که مدیریت میکند آیا محتوای خزیدهشده از سایت شما میتواند در آموزش مدلهای Gemini استفاده شود یا نه؛ مستندات Google صریحاً مینویسد که این توکن روی رتبهبندی جستوجو اثری ندارد.
نتیجه عملی این تفکیک: «آیا باتهای AI را مسدود کنیم» یک سؤال نیست، سه سؤال است. بستن باتهای آموزش و باز ماندن برای باتهای جستوجو ممکن است و مستندات صریحاً از آن پشتیبانی میکند؛ OpenAI مینویسد هر تنظیم مستقل عمل میکند و یک سایت میتواند به OAI-SearchBot اجازه دهد و GPTBot را رد کند. برای باتهایی که کاربر فعالشان میکند یادداشت جداگانهای هست: چون خزش خودکار نیستند، قواعد robots.txt ممکن است در هر حالتی اعمال نشود.
ماتریس تصمیم: چه چیزی به کدام بات باز میشود
تصمیم باید بر اساس نوع صفحه گرفته شود. چارچوب زیر خلاصه رویهای است که ما بهعنوان آژانس در سایتهای کلینیک و B2B اجرا میکنیم؛ در هر سایتی نتیجه یکسانی نمیدهد، اما سؤالها را به ترتیب درست میپرسد.
- باتهای جستوجو (OAI-SearchBot، Claude-SearchBot و مشابهها): در هر صفحهای که میخواهید دیده شود باز. بستن اینها یعنی کنار کشیدن از نتایج جستوجوی AI؛ OpenAI این را مستقیم مینویسد.
- باتهای آموزش (GPTBot، ClaudeBot، Google-Extended): بسته به مدل کسبوکار سایت. باز گذاشتن آنها روی محتوای وبلاگ و راهنما میتواند بهطور غیرمستقیم به مرئی بودن کمک کند؛ بستن آنها روی داده اصیل، پژوهش و محتوای پولی انتخابی قابل دفاع است.
- باتهای فعالشده توسط کاربر (ChatGPT-User، Claude-User): باز. لحظهای که این بات میآید، لحظهای است که یک کاربر واقعی در آستانه دیدن صفحه شما داخل یک پاسخ است.
رایجترین خطایی که در سایتهای کلینیک در ترکیه میبینیم، تصمیم «ما به روی AI بستهایم» است که با یک خط گرفته میشود و باتهای جستوجو را هم مسدود میکند. چند ماه بعد صاحبان این سایتها میپرسند «چرا ChatGPT ما را پیشنهاد نمیدهد»؛ پاسخ در robots.txt خودشان است.
robots.txt: واقعاً چه میکند و چه نمیکند
مستندات Google حد robots.txt را روشن مینویسد: این فایل به خزندهها میگوید به کدام URLها میتوانند دسترسی داشته باشند و اساساً برای جلوگیری از غرق شدن سایت در درخواستهاست؛ ابزاری برای بیرون نگه داشتن یک صفحه از Google نیست. برای خارج کردن یک صفحه از ایندکس، noindex یا محافظت با رمز لازم است. همین منطق برای باتهای AI هم صادق است: robots.txt یک درخواست است، نه یک دیوار فنی. ارائهدهندگان بزرگی که مستندات دارند، مستند میکنند که به این درخواست احترام میگذارند؛ برای باتهای مستندنشده تنها تضمین، کنترل دسترسی سمت سرور است.
در عمل نوشتن فایل در سه بلوک خوانایی را بالا میبرد: باتهای موتور جستوجو، باتهای جستوجوی AI و کاربر، باتهای آموزش AI. یادداشت کردن دلیل باز یا بسته بودن هر مسیر در هر بلوک با یک خط کامنت، برای کسی که شش ماه بعد فایل را باز میکند وقت ذخیره میکند. OpenAI مینویسد تغییرات robots.txt در حدود 24 ساعت در سیستمهایش اعمال میشود؛ تغییر دادن و همان روز دنبال نتیجه در لاگ گشتن گمراهکننده است.
llms.txt: چه هست و چه نیست
llms.txt پیشنهاد فایلی است که در ریشه سایت قرار میگیرد و به مدلهای زبانی با قالب Markdown میگوید سایت درباره چیست و منابع مهم کجا هستند. متن خود پیشنهاد قالب را تعریف میکند: یک تیتر H1، یک خلاصه داخل بلوک نقلقول، و بعد فهرست لینکهای توضیحدار زیر تیترهای H2. هدف این است که یک مدل بتواند سایت را بدون پردازش کل HTML بفهمد.
اینجا باید صادق بود. llms.txt سازوکار کنترل دسترسی نیست؛ هیچ باتی را مسدود نمیکند و هیچ باتی را ملزم نمیکند. مستندات خزندههای Google این فایل را بهعنوان سازوکار پشتیبانیشده فهرست نمیکند؛ مستندات باتهای OpenAI و Anthropic هم بر robots.txt تکیه میکنند. یعنی llms.txt جایگزین robots.txt نیست، حداکثر یک فایل معرفی در کنار آن است. هزینه انتشارش پایین است، اما انتظار مرئی بودن از آن یک فرض اندازهگیرینشده است.
پیشنهاد عملی ما این است: llms.txt را آماده کنید، اما داخلش پانزده بیست صفحه واقعاً بهترِ سایت باشد، نه کل نقشه سایت. تنها راه فهمیدن اینکه چه کسی فایل را میخواند، شمردن درخواستهای آن مسیر در لاگ سرور است؛ بعد از انتشار این عدد را سه ماه دنبال کنید و فقط آن موقع به تصمیم برگردید.
بررسی لاگ: رفتار، نه فایل
استراتژی دسترسی چیزی نیست که در robots.txt نوشته شود، چیزی است که در لاگ دیده شود. کار ماهانه این است که درخواستهای لاگ سرور را بر اساس نام عامل کاربر گروهبندی کنید و سه سؤال بپرسید: باتی که مسدود کردهاید هنوز میآید؟ باتی که باز کردهاید میآید؟ کدام صفحهها را میگیرد؟ اگر پاسخ سؤال اول «بله» است، یا قاعده اشتباه نوشته شده، یا بات با هویتی مستندنشده میآید.
نام عامل کاربر قابل جعل است. به همین دلیل Google و ارائهدهندگان بزرگ محدوده IP باتهایشان را منتشر میکنند؛ در ترافیک مشکوک، محدوده IP را تأیید کنید نه نام را. اگر در سایت مشکل بار مرتبط با AI میبینید، راهحل معمولاً مسدود کردن همه باتها نیست، بلکه جدا کردن ترافیک جعلی و اعمال Crawl-delay یا محدودیت نرخ سمت سرور روی باتهای واقعی است.
این بررسی را بهعنوان یک بند ثابت در ممیزی سئوی فنی نگه میداریم؛ تفاوت بین آخرین نسخه robots.txt و رفتار در لاگ، تنها معیار این است که سایت واقعاً به کدام بات چه میگوید.
نتیجه
مدیریت خزندههای AI یک تصمیم مسدودسازی واحد نیست، سه پاسخ جدا به سه خانواده بات است. باز ماندن برای باتهای جستوجو پیششرط مرئی بودن است، باتهای آموزش تصمیمی بر اساس مدل کسبوکار، و باتهای کاربر تقریباً همیشه باز. robots.txt جایی است که این تصمیمها نوشته میشود و بررسی لاگ تنها مدرک این است که واقعاً اجرا میشوند. llms.txt در این تصویر یک فایل معرفی کوچک است؛ آماده کردنش ضرری ندارد، اما خود استراتژی نیست.