گوگل میتواند PDF را ایندکس کند، اما هر سندی نباید جای صفحهٔ HTML را بگیرد. اگر فایل قرار است در جستوجو دیده شود، متن آن باید قابل انتخاب باشد، عنوان و نام روشن داشته باشد، از صفحهای مرتبط لینک بگیرد و با پاسخ HTTP درست تحویل شود. برای نسخهٔ تکراری، کنونیکال را در هدر Link بگذارید؛ برای جلوگیری از ایندکس فایل از X-Robots-Tag استفاده کنید.
راهنمای محصول، گزارش پژوهشی، دفترچهٔ دستگاه و فرمهای قابل دانلود اغلب به صورت PDF منتشر میشوند. گاهی همان اطلاعات در یک صفحهٔ سایت هم وجود دارد. مدیر سایت در این وضعیت با چند پرسش روبهرو میشود: آیا فایل خودش در گوگل نمایش داده میشود؟ کدام نسخه باید نتیجهٔ اصلی باشد؟ چرا بعضی فایلها با وجود لینک مستقیم دیده نمیشوند؟
پاسخ از خود فایل شروع میشود، اما به آن محدود نیست. متن و ساختار PDF، نشانی فایل، لینک صفحهٔ میزبان، هدرهای سرور و رابطهٔ آن با نسخهٔ HTML باید با هدف انتشار هماهنگ باشند. این مقاله روی تصمیمها و تنظیمات مخصوص فایل PDF تمرکز دارد؛ راهنمای عمومی بهینه سازی سئو سایت دامنهٔ وسیعتری از صفحات وب را پوشش میدهد.
آیا گوگل فایل PDF را ایندکس میکند؟
بله. PDF در فهرست نوع فایلهایی است که گوگل میتواند محتوای آنها را پردازش و ایندکس کند. با این حال، قابل ایندکس بودن به معنی ورود قطعی هر فایل به نتایج نیست. خزنده باید نشانی را پیدا کند، به فایل دسترسی داشته باشد، متن قابل فهمی از آن استخراج کند و آن را برای نمایش مناسب بداند.
طبق فهرست رسمی نوع فایلهای قابل ایندکس گوگل، نوع فایل از پاسخ سرور تشخیص داده میشود. برای PDF معمولاً Content-Type از نوع application/pdf انتظار میرود. خطای پاسخ، محدودیت دسترسی، نشانی ناپایدار یا فایلی که فقط عکس صفحات است، بررسی آن را دشوار میکند. نخستین آزمون این است که فایل را بدون ورود به حساب، با همان نشانی عمومی باز کنید و متن آن را انتخاب یا جستوجو کنید.
ممکن است PDF اصلاً برای ورود به جستوجو مناسب نباشد. فرم موقت، نسخهٔ چاپی تکراری یا سندی که صفحهٔ HTML کاملتر و خواناتری دارد، میتواند نقش دانلود برای کاربر داشته باشد و نتیجهٔ اصلی جستوجو صفحهٔ HTML بماند. تصمیم را براساس نیاز کاربر و تفاوت محتوای دو نسخه بگیرید، نه صرفاً پسوند فایل.
چه زمانی صفحهٔ HTML بهتر از PDF است؟
وقتی کاربر باید محتوا را روی موبایل بخواند، میان بخشها حرکت کند، فرم پر کند یا مرتب نسخهٔ تازه ببیند، صفحهٔ HTML معمولاً تجربهٔ بهتری میدهد. PDF برای سندی که چیدمان ثابت، چاپ، امضا، بایگانی یا دانلود آن مهم است کاربرد روشنتری دارد. هر دو میتوانند کنار هم باشند، به شرطی که نقششان مشخص باشد.
برای نمونه، راهنمای خرید یک محصول با پرسشهای پرتکرار، قیمت و موجودی متغیر بهتر است در HTML باشد. دفترچهٔ فنی ۴۰ صفحهای همان محصول میتواند PDF جداگانه داشته باشد. صفحهٔ محصول یا راهنما باید توضیح کوتاهی دربارهٔ فایل بدهد و لینک دانلود آن را با متن مشخص نشان دهد؛ کاربر نباید مجبور شود پیش از فهمیدن محتوا سندی سنگین باز کند.
اگر محتوای PDF و HTML تقریباً یکسان است، یکی را نسخهٔ ترجیحی تعیین کنید. اگر PDF جزئیات بیشتر، جدول چاپی یا پیوستهایی دارد که در HTML نیست، ممکن است هر دو ارزش مستقل داشته باشند. این تصمیم را با نمونهٔ واقعی سند بگیرید؛ قاعدهٔ یکسان برای همهٔ PDFهای سایت معمولاً دقیق نیست.

متن PDF باید چگونه آماده شود؟
فایلی که از متن اصلی ساخته شده، معمولاً متن قابل انتخاب و جستوجو دارد. در فایل اسکنشده ممکن است هر صفحه فقط یک تصویر باشد. در این حالت ظاهر سند برای انسان خواناست، اما ماشین و ابزارهای دسترسپذیری به متن واقعی دسترسی محدودی دارند. اگر فایل از اسکن ساخته شده، OCR را اجرا و خروجی آن را بازبینی کنید.
آزمون سادهای انجام دهید: یک جملهٔ میانی را با ماوس انتخاب و در جای دیگری کپی کنید. اگر چیزی کپی نمیشود یا کلمات بههمریختهاند، لایهٔ متن مشکل دارد. OCR هم همیشه بیخطا نیست؛ اعداد، نیمفاصله، حروف فارسی مشابه و جدولها را نمونهگیری کنید. هدف فقط پر کردن فایل با لایهٔ متن نیست، بلکه رساندن متن درست به خواننده و موتور جستوجو است.
عنوان سند، بخشبندی، فهرست و ترتیب خواندن را از فایل اصلی درست بسازید. اگر ۳۰ صفحه تصویر اسکنشده را به یک PDF تبدیل کردهاید، بهتر است ابتدا متن و ساختار را بازیابی کنید. پیوندهای داخل فایل نیز باید واقعاً قابل کلیک باشند. برای سندهای بلند، نشانکها به کاربر کمک میکنند میان فصلها حرکت کند؛ اینها جایگزین لینکدهی و ساختار صفحهٔ میزبان نیستند.
نام فایل را کوتاه، معنادار و پایدار بگذارید. نامی مانند guide-installation-model-x.pdf از final-v7-new2.pdf برای مدیریت و اشتراکگذاری روشنتر است. نام فایل بهتنهایی تضمین رتبه نیست. عنوان داخلی سند و متن صفحهای که به آن لینک میدهد نیز باید موضوع را دقیق توضیح دهند.
متادیتای PDF را چگونه تنظیم کنیم؟
در مشخصات سند، عنوانی بنویسید که موضوع و نسخهٔ فایل را برای کاربر روشن کند. نام نویسنده یا سازمان، موضوع و در صورت نیاز کلیدواژههای مرتبط را هم میتوان ثبت کرد. این فیلدها ابزار نظمدادن به سند هستند؛ پر کردن فهرستی طولانی از کلمات تکراری جای محتوای روشن و متن قابل جستوجو را نمیگیرد.
عنوان داخلی باید با جلد و محتوای واقعی فایل هماهنگ باشد. اگر نام فایل «راهنمای نصب» است ولی Document Title هنوز «Untitled» یا نام فایل خروجی نرمافزار را نشان میدهد، پیش از انتشار آن را اصلاح کنید. هنگام بازبینی نسخهٔ نهایی، Properties را باز کنید و عنوان، زبان، نویسنده و تاریخ نسخه را با سند مطابقت دهید.
برای سند فارسی، خوانایی فونت و ترتیب متن را روی چند نمایشگر آزمایش کنید. اندازهٔ ثابت صفحهٔ PDF روی موبایل ممکن است به بزرگنمایی مداوم نیاز داشته باشد. اگر مخاطب عمدتاً موبایلی است، نسخهٔ HTML خلاصه یا کامل میتواند راه ورود به محتوا باشد و PDF نقش فایل قابل دانلود را نگه دارد. این تصمیم تجربهٔ کاربر را بهتر میکند، اما بهتنهایی وعدهٔ رتبهٔ بالاتر نیست.
فایل را چگونه به گوگل و کاربر معرفی کنیم؟
PDF مهم باید از یک صفحهٔ HTML مرتبط لینک بگیرد. متن لینک، نوع سند و فایدهٔ دانلود را توضیح دهد؛ مثلاً «دانلود دفترچهٔ نصب مدل X» روشنتر از «اینجا کلیک کنید» است. صفحهٔ میزبان نیز باید موضوع را در چند جمله معرفی کند تا کاربر پیش از دانلود بداند چه چیزی دریافت میکند.
نشانی فایل را تا جای ممکن پایدار نگه دارید. اگر هر بار نسخهٔ تازه را با نام دیگری منتشر میکنید، لینکهای قدیمی ممکن است به فایل منسوخ برسند یا خطای ۴۰۴ بدهند. برای اسنادی که نسخههای تاریخی باید بمانند، نسخه را در نام فایل و صفحهٔ فهرست مشخص کنید. برای سندی که فقط یک نسخهٔ جاری دارد، راه روشن برای هدایت نشانی قدیمی به نسخهٔ جدید تعیین کنید.
لینکهای درون PDF میتوانند خواننده را به صفحهٔ محصول، بخش پشتیبانی یا منبع اصلی ببرند. آنها را برای استفادهٔ واقعی کاربر بگذارید، نه برای انباشتن انکر. برای کشف صفحات سایت، به لینکهای HTML روی خود وبسایت نیز نیاز دارید. فایل دانلودی نباید تنها مسیر دسترسی به یک صفحهٔ مهم باشد.
اگر PDF در CMS یا CDN میزبانی میشود، پاسخ عمومی آن را بررسی کنید: کد ۲۰۰، نوع فایل درست، نبودن چالش امنیتی برای بازدیدکنندهٔ ناشناس و نشانی نهایی بدون زنجیرهٔ تغییر مسیر. در چکلیست سئو تکنیکال این آزمونها برای صفحات و فایلهای عمومی کنار هم آمدهاند؛ اینجا آنها را مشخصاً روی نشانی فایل اجرا کنید.
اگر HTML و PDF یک محتوا دارند، کنونیکال کجا قرار میگیرد؟
PDF مانند صفحهٔ HTML بخشی برای قرار دادن تگ کنونیکال در head ندارد. اگر میخواهید نسخهٔ HTML را برای محتوای تکراری ترجیح دهید، میتوانید در پاسخ HTTP خود فایل PDF هدر Link با نشانی مطلق HTML و مقدار rel=canonical بفرستید. این روش در راهنمای کنونیکال گوگل برای فایلهای غیر HTML توضیح داده شده است.
نمونهٔ هدر به این شکل است: Link: <https://example.com/guide/>; rel="canonical". این نشانی باید به صفحهای برسد که واقعاً محتوای اصلی سند را پوشش میدهد. کنونیکال یک نشانهٔ ترجیح است، نه دستور قطعی؛ گوگل میتواند بر اساس سیگنالهای دیگر نسخهٔ متفاوتی را انتخاب کند. پس از انتشار، هدر PDF را با درخواست مستقیم بررسی کنید و انتخاب نهایی را در ابزارهای گوگل بسنجید.
اگر PDF سند مستقل و ارزشمند است و HTML فقط آن را معرفی میکند، کنونیکال کردن فایل به صفحهٔ معرفی ممکن است انتخاب درستی نباشد. در این سناریو صفحه و فایل دو کار متفاوت انجام میدهند: یکی زمینه و مسیر دسترسی را میدهد، دیگری سند کامل است. قبل از تنظیم هدر، تفاوت واقعی محتوا و هدف هر نشانی را بنویسید.
برای شرح مفصل تصمیمهای کنونیکال در صفحات وب، مقالهٔ تگ کنونیکال را ببینید. نکتهٔ ویژهٔ PDF فقط محل ثبت نشانه است: سرور یا CDN باید هدر درست را همراه پاسخ فایل بفرستد. تغییر تنظیمات افزونهٔ سئوی صفحهٔ دانلود لزوماً هدر خود فایل را عوض نمیکند.

اگر نمیخواهیم PDF در نتایج باشد، چه کنیم؟
برای جلوگیری از ایندکس فایل PDF عمومی، دستور X-Robots-Tag: noindex را روی پاسخ HTTP همان فایل بگذارید. تگ متای robots داخل HTML صفحهٔ معرفی، روی PDF جداگانه اعمال نمیشود. مستندات گوگل دربارهٔ X-Robots-Tag بهصراحت این هدر را برای منابع غیر HTML مانند PDF معرفی میکند.
خزنده باید بتواند فایل را دریافت کند تا دستور noindex را ببیند. اگر نشانی را همزمان در robots.txt ببندید، ممکن است دسترسی به هدر noindex از بین برود. اگر فایل محرمانه است، noindex ابزار حفاظت نیست؛ باید دسترسی را با احراز هویت یا حذف عمومی فایل ببندید. محرمانگی و عدم نمایش در نتایج جستوجو دو نیاز متفاوتاند.
پیش از اعمال یک قانون کلی برای همهٔ PDFهای سایت، نمونهها را دستهبندی کنید. دفترچههای محصول، گزارشهای عمومی و فایلهای آرشیوی ممکن است به کشف از جستوجو کمک کنند؛ فرمهای داخلی یا نسخههای چاپی تکراری شاید چنین هدفی نداشته باشند. قانون سرور را روی چند نشانی آزمایش کنید تا مطمئن شوید هدر ناخواسته به همهٔ فایلها یا حتی صفحات HTML سرایت نکرده است.
اگر نمیدانید چرا فایل با وجود noindex هنوز در گزارشها دیده میشود، ابتدا زمان آخرین خزش، پاسخ HTTP فعلی و دسترسی خزنده را بررسی کنید. حذف نتیجه ممکن است فوری نباشد. راهنمای robots.txt و محدودیتهای آن کمک میکند تفاوت بستن خزش و جلوگیری از ایندکس را برای سایر نشانیها نیز درست تشخیص دهید.
چکلیست آزمون پس از انتشار PDF
از نسخهٔ نهایی فایل یک نشانی عمومی بردارید و آن را بدون ورود به حساب باز کنید. متن یک صفحهٔ میانی را انتخاب و جستوجو کنید. عنوان Document Properties، نام فایل، زبان و نسخه را با موضوع واقعی سند مقایسه کنید. لینکهای داخل فایل را در دسکتاپ و موبایل امتحان کنید و مطمئن شوید به نشانی درست میروند.
سپس هدرها را بخوانید: کد پاسخ، Content-Type و در صورت نیاز Link برای کنونیکال یا X-Robots-Tag برای noindex. تنظیمات را روی نشانی خود فایل بررسی کنید، نه فقط صفحهای که دکمهٔ دانلود دارد. اگر فایل از CDN تحویل میشود، پاسخ CDN را با پاسخ مبدا مقایسه کنید تا هدرها در مسیر حذف یا تغییر نکرده باشند.
در صفحهٔ HTML میزبان، لینک دانلود با متن مشخص و توضیح کوتاه بگذارید. اگر سند نسخهٔ جدید گرفته است، لینکهای داخلی به نسخهٔ قبلی را پیدا و اصلاح کنید. در پایان، نشانی فایل را در سرچ کنسول بررسی کنید و وضعیت خزش و ایندکس را با تصمیمی که برای آن سند گرفتهاید مقایسه کنید. صرف باز شدن فایل در مرورگر به معنی حضور آن در گوگل نیست.
برای مجموعهٔ بزرگ PDF، یک جدول مدیریت داخلی بسازید که نشانی، عنوان، نوع سند، صفحهٔ میزبان، وضعیت ایندکس مطلوب، هدرهای لازم و تاریخ بازبینی را ثبت کند. این جدول برای خود تیم است و لازم نیست روی سایت منتشر شود. با آن میتوان فایلهای تکراری، نسخههای منسوخ و لینکهای شکسته را پیش از تبدیل شدن به مسئلهٔ گسترده پیدا کرد.
جمعبندی
PDF وقتی برای جستوجو مفید است که سند واقعاً به نیاز کاربر پاسخ دهد و فایل عمومی سالمی باشد. متن قابل انتخاب، عنوان روشن، لینک از صفحهٔ مرتبط و پاسخ HTTP درست را پایه قرار دهید. اگر نسخهٔ HTML و PDF همپوشانی دارند، نسخهٔ ترجیحی را با دلیل انتخاب و هدر کنونیکال را روی PDF تنظیم کنید؛ اگر فایل نباید در نتایج باشد، noindex را در X-Robots-Tag همان فایل بگذارید و نتیجه را بررسی کنید.
سوالات متداول
آیا نام فایل PDF برای سئو کافی است؟
خیر. نام معنادار به مدیریت و فهم موضوع کمک میکند، اما متن قابل جستوجو، عنوان سند، لینکهای صفحهٔ میزبان و دسترسی HTTP نیز اهمیت دارند.
آیا باید هر PDF را به صفحهٔ HTML کنونیکال کنیم؟
خیر. وقتی دو نشانی محتوای عمدتاً یکسانی دارند، نسخهٔ ترجیحی را مشخص کنید. PDF مستقل و صفحهٔ معرفی کوتاه لزوماً محتوای تکراری نیستند.
برای PDF اسکنشده چه کاری لازم است؟
OCR را اجرا کنید و متن خروجی را نمونهگیری کنید. اگر کلمات، اعداد یا ترتیب خواندن خراب است، فایل را پیش از انتشار اصلاح کنید.
آیا بستن PDF در robots.txt همان noindex است؟
خیر. بستن خزش میتواند مانع دیدن هدر noindex شود. برای PDF عمومی که نباید در نتایج باشد، X-Robots-Tag را روی پاسخ فایل بگذارید و دسترسی خزنده را برای خواندن آن حفظ کنید.
منابع

