سئو تکنیکال

سئو فایل PDF؛ ایندکس، متادیتا، کنونیکال و لینک‌ها

تیم تحریریه سئودو انتشار: ۱۰ مهر ۱۴۰۵ 12 دقیقه مطالعه
سئو فایل PDF؛ ایندکس، متادیتا، کنونیکال و لینک‌ها
TL;DRخلاصه ۳۰ ثانیه‌ای

گوگل می‌تواند PDF را ایندکس کند، اما هر سندی نباید جای صفحهٔ HTML را بگیرد. اگر فایل قرار است در جست‌وجو دیده شود، متن آن باید قابل انتخاب باشد، عنوان و نام روشن داشته باشد، از صفحه‌ای مرتبط لینک بگیرد و با پاسخ HTTP درست تحویل شود. برای نسخهٔ تکراری، کنونیکال را در هدر Link بگذارید؛ برای جلوگیری از ایندکس فایل از X-Robots-Tag استفاده کنید.

راهنمای محصول، گزارش پژوهشی، دفترچهٔ دستگاه و فرم‌های قابل دانلود اغلب به صورت PDF منتشر می‌شوند. گاهی همان اطلاعات در یک صفحهٔ سایت هم وجود دارد. مدیر سایت در این وضعیت با چند پرسش روبه‌رو می‌شود: آیا فایل خودش در گوگل نمایش داده می‌شود؟ کدام نسخه باید نتیجهٔ اصلی باشد؟ چرا بعضی فایل‌ها با وجود لینک مستقیم دیده نمی‌شوند؟

پاسخ از خود فایل شروع می‌شود، اما به آن محدود نیست. متن و ساختار PDF، نشانی فایل، لینک صفحهٔ میزبان، هدرهای سرور و رابطهٔ آن با نسخهٔ HTML باید با هدف انتشار هماهنگ باشند. این مقاله روی تصمیم‌ها و تنظیمات مخصوص فایل PDF تمرکز دارد؛ راهنمای عمومی بهینه سازی سئو سایت دامنهٔ وسیع‌تری از صفحات وب را پوشش می‌دهد.

آیا گوگل فایل PDF را ایندکس می‌کند؟

بله. PDF در فهرست نوع فایل‌هایی است که گوگل می‌تواند محتوای آن‌ها را پردازش و ایندکس کند. با این حال، قابل ایندکس بودن به معنی ورود قطعی هر فایل به نتایج نیست. خزنده باید نشانی را پیدا کند، به فایل دسترسی داشته باشد، متن قابل فهمی از آن استخراج کند و آن را برای نمایش مناسب بداند.

طبق فهرست رسمی نوع فایل‌های قابل ایندکس گوگل، نوع فایل از پاسخ سرور تشخیص داده می‌شود. برای PDF معمولاً Content-Type از نوع application/pdf انتظار می‌رود. خطای پاسخ، محدودیت دسترسی، نشانی ناپایدار یا فایلی که فقط عکس صفحات است، بررسی آن را دشوار می‌کند. نخستین آزمون این است که فایل را بدون ورود به حساب، با همان نشانی عمومی باز کنید و متن آن را انتخاب یا جست‌وجو کنید.

ممکن است PDF اصلاً برای ورود به جست‌وجو مناسب نباشد. فرم موقت، نسخهٔ چاپی تکراری یا سندی که صفحهٔ HTML کامل‌تر و خواناتری دارد، می‌تواند نقش دانلود برای کاربر داشته باشد و نتیجهٔ اصلی جست‌وجو صفحهٔ HTML بماند. تصمیم را براساس نیاز کاربر و تفاوت محتوای دو نسخه بگیرید، نه صرفاً پسوند فایل.

چه زمانی صفحهٔ HTML بهتر از PDF است؟

وقتی کاربر باید محتوا را روی موبایل بخواند، میان بخش‌ها حرکت کند، فرم پر کند یا مرتب نسخهٔ تازه ببیند، صفحهٔ HTML معمولاً تجربهٔ بهتری می‌دهد. PDF برای سندی که چیدمان ثابت، چاپ، امضا، بایگانی یا دانلود آن مهم است کاربرد روشن‌تری دارد. هر دو می‌توانند کنار هم باشند، به شرطی که نقششان مشخص باشد.

برای نمونه، راهنمای خرید یک محصول با پرسش‌های پرتکرار، قیمت و موجودی متغیر بهتر است در HTML باشد. دفترچهٔ فنی ۴۰ صفحه‌ای همان محصول می‌تواند PDF جداگانه داشته باشد. صفحهٔ محصول یا راهنما باید توضیح کوتاهی دربارهٔ فایل بدهد و لینک دانلود آن را با متن مشخص نشان دهد؛ کاربر نباید مجبور شود پیش از فهمیدن محتوا سندی سنگین باز کند.

اگر محتوای PDF و HTML تقریباً یکسان است، یکی را نسخهٔ ترجیحی تعیین کنید. اگر PDF جزئیات بیشتر، جدول چاپی یا پیوست‌هایی دارد که در HTML نیست، ممکن است هر دو ارزش مستقل داشته باشند. این تصمیم را با نمونهٔ واقعی سند بگیرید؛ قاعدهٔ یکسان برای همهٔ PDFهای سایت معمولاً دقیق نیست.

مقایسه صفحه HTML و فایل PDF برای انتشار محتوای قابل جست‌وجو
نمی‌دانی وضعیت سئوی سایتت چطور است؟گزارش آنالیز رایگان بگیر — با راهکار اختصاصی برای سایت خودت.
آنالیز سئو

متن PDF باید چگونه آماده شود؟

فایلی که از متن اصلی ساخته شده، معمولاً متن قابل انتخاب و جست‌وجو دارد. در فایل اسکن‌شده ممکن است هر صفحه فقط یک تصویر باشد. در این حالت ظاهر سند برای انسان خواناست، اما ماشین و ابزارهای دسترس‌پذیری به متن واقعی دسترسی محدودی دارند. اگر فایل از اسکن ساخته شده، OCR را اجرا و خروجی آن را بازبینی کنید.

آزمون ساده‌ای انجام دهید: یک جملهٔ میانی را با ماوس انتخاب و در جای دیگری کپی کنید. اگر چیزی کپی نمی‌شود یا کلمات به‌هم‌ریخته‌اند، لایهٔ متن مشکل دارد. OCR هم همیشه بی‌خطا نیست؛ اعداد، نیم‌فاصله، حروف فارسی مشابه و جدول‌ها را نمونه‌گیری کنید. هدف فقط پر کردن فایل با لایهٔ متن نیست، بلکه رساندن متن درست به خواننده و موتور جست‌وجو است.

عنوان سند، بخش‌بندی، فهرست و ترتیب خواندن را از فایل اصلی درست بسازید. اگر ۳۰ صفحه تصویر اسکن‌شده را به یک PDF تبدیل کرده‌اید، بهتر است ابتدا متن و ساختار را بازیابی کنید. پیوندهای داخل فایل نیز باید واقعاً قابل کلیک باشند. برای سندهای بلند، نشانک‌ها به کاربر کمک می‌کنند میان فصل‌ها حرکت کند؛ این‌ها جایگزین لینک‌دهی و ساختار صفحهٔ میزبان نیستند.

نام فایل را کوتاه، معنادار و پایدار بگذارید. نامی مانند guide-installation-model-x.pdf از final-v7-new2.pdf برای مدیریت و اشتراک‌گذاری روشن‌تر است. نام فایل به‌تنهایی تضمین رتبه نیست. عنوان داخلی سند و متن صفحه‌ای که به آن لینک می‌دهد نیز باید موضوع را دقیق توضیح دهند.

متادیتای PDF را چگونه تنظیم کنیم؟

در مشخصات سند، عنوانی بنویسید که موضوع و نسخهٔ فایل را برای کاربر روشن کند. نام نویسنده یا سازمان، موضوع و در صورت نیاز کلیدواژه‌های مرتبط را هم می‌توان ثبت کرد. این فیلدها ابزار نظم‌دادن به سند هستند؛ پر کردن فهرستی طولانی از کلمات تکراری جای محتوای روشن و متن قابل جست‌وجو را نمی‌گیرد.

عنوان داخلی باید با جلد و محتوای واقعی فایل هماهنگ باشد. اگر نام فایل «راهنمای نصب» است ولی Document Title هنوز «Untitled» یا نام فایل خروجی نرم‌افزار را نشان می‌دهد، پیش از انتشار آن را اصلاح کنید. هنگام بازبینی نسخهٔ نهایی، Properties را باز کنید و عنوان، زبان، نویسنده و تاریخ نسخه را با سند مطابقت دهید.

برای سند فارسی، خوانایی فونت و ترتیب متن را روی چند نمایشگر آزمایش کنید. اندازهٔ ثابت صفحهٔ PDF روی موبایل ممکن است به بزرگ‌نمایی مداوم نیاز داشته باشد. اگر مخاطب عمدتاً موبایلی است، نسخهٔ HTML خلاصه یا کامل می‌تواند راه ورود به محتوا باشد و PDF نقش فایل قابل دانلود را نگه دارد. این تصمیم تجربهٔ کاربر را بهتر می‌کند، اما به‌تنهایی وعدهٔ رتبهٔ بالاتر نیست.

فایل را چگونه به گوگل و کاربر معرفی کنیم؟

PDF مهم باید از یک صفحهٔ HTML مرتبط لینک بگیرد. متن لینک، نوع سند و فایدهٔ دانلود را توضیح دهد؛ مثلاً «دانلود دفترچهٔ نصب مدل X» روشن‌تر از «اینجا کلیک کنید» است. صفحهٔ میزبان نیز باید موضوع را در چند جمله معرفی کند تا کاربر پیش از دانلود بداند چه چیزی دریافت می‌کند.

نشانی فایل را تا جای ممکن پایدار نگه دارید. اگر هر بار نسخهٔ تازه را با نام دیگری منتشر می‌کنید، لینک‌های قدیمی ممکن است به فایل منسوخ برسند یا خطای ۴۰۴ بدهند. برای اسنادی که نسخه‌های تاریخی باید بمانند، نسخه را در نام فایل و صفحهٔ فهرست مشخص کنید. برای سندی که فقط یک نسخهٔ جاری دارد، راه روشن برای هدایت نشانی قدیمی به نسخهٔ جدید تعیین کنید.

لینک‌های درون PDF می‌توانند خواننده را به صفحهٔ محصول، بخش پشتیبانی یا منبع اصلی ببرند. آن‌ها را برای استفادهٔ واقعی کاربر بگذارید، نه برای انباشتن انکر. برای کشف صفحات سایت، به لینک‌های HTML روی خود وب‌سایت نیز نیاز دارید. فایل دانلودی نباید تنها مسیر دسترسی به یک صفحهٔ مهم باشد.

اگر PDF در CMS یا CDN میزبانی می‌شود، پاسخ عمومی آن را بررسی کنید: کد ۲۰۰، نوع فایل درست، نبودن چالش امنیتی برای بازدیدکنندهٔ ناشناس و نشانی نهایی بدون زنجیرهٔ تغییر مسیر. در چک‌لیست سئو تکنیکال این آزمون‌ها برای صفحات و فایل‌های عمومی کنار هم آمده‌اند؛ اینجا آن‌ها را مشخصاً روی نشانی فایل اجرا کنید.

اگر HTML و PDF یک محتوا دارند، کنونیکال کجا قرار می‌گیرد؟

PDF مانند صفحهٔ HTML بخشی برای قرار دادن تگ کنونیکال در head ندارد. اگر می‌خواهید نسخهٔ HTML را برای محتوای تکراری ترجیح دهید، می‌توانید در پاسخ HTTP خود فایل PDF هدر Link با نشانی مطلق HTML و مقدار rel=canonical بفرستید. این روش در راهنمای کنونیکال گوگل برای فایل‌های غیر HTML توضیح داده شده است.

نمونهٔ هدر به این شکل است: Link: <https://example.com/guide/>; rel="canonical". این نشانی باید به صفحه‌ای برسد که واقعاً محتوای اصلی سند را پوشش می‌دهد. کنونیکال یک نشانهٔ ترجیح است، نه دستور قطعی؛ گوگل می‌تواند بر اساس سیگنال‌های دیگر نسخهٔ متفاوتی را انتخاب کند. پس از انتشار، هدر PDF را با درخواست مستقیم بررسی کنید و انتخاب نهایی را در ابزارهای گوگل بسنجید.

اگر PDF سند مستقل و ارزشمند است و HTML فقط آن را معرفی می‌کند، کنونیکال کردن فایل به صفحهٔ معرفی ممکن است انتخاب درستی نباشد. در این سناریو صفحه و فایل دو کار متفاوت انجام می‌دهند: یکی زمینه و مسیر دسترسی را می‌دهد، دیگری سند کامل است. قبل از تنظیم هدر، تفاوت واقعی محتوا و هدف هر نشانی را بنویسید.

برای شرح مفصل تصمیم‌های کنونیکال در صفحات وب، مقالهٔ تگ کنونیکال را ببینید. نکتهٔ ویژهٔ PDF فقط محل ثبت نشانه است: سرور یا CDN باید هدر درست را همراه پاسخ فایل بفرستد. تغییر تنظیمات افزونهٔ سئوی صفحهٔ دانلود لزوماً هدر خود فایل را عوض نمی‌کند.

بررسی متن، لینک‌ها و هدرهای HTTP در سئو فایل PDF

اگر نمی‌خواهیم PDF در نتایج باشد، چه کنیم؟

برای جلوگیری از ایندکس فایل PDF عمومی، دستور X-Robots-Tag: noindex را روی پاسخ HTTP همان فایل بگذارید. تگ متای robots داخل HTML صفحهٔ معرفی، روی PDF جداگانه اعمال نمی‌شود. مستندات گوگل دربارهٔ X-Robots-Tag به‌صراحت این هدر را برای منابع غیر HTML مانند PDF معرفی می‌کند.

خزنده باید بتواند فایل را دریافت کند تا دستور noindex را ببیند. اگر نشانی را هم‌زمان در robots.txt ببندید، ممکن است دسترسی به هدر noindex از بین برود. اگر فایل محرمانه است، noindex ابزار حفاظت نیست؛ باید دسترسی را با احراز هویت یا حذف عمومی فایل ببندید. محرمانگی و عدم نمایش در نتایج جست‌وجو دو نیاز متفاوت‌اند.

پیش از اعمال یک قانون کلی برای همهٔ PDFهای سایت، نمونه‌ها را دسته‌بندی کنید. دفترچه‌های محصول، گزارش‌های عمومی و فایل‌های آرشیوی ممکن است به کشف از جست‌وجو کمک کنند؛ فرم‌های داخلی یا نسخه‌های چاپی تکراری شاید چنین هدفی نداشته باشند. قانون سرور را روی چند نشانی آزمایش کنید تا مطمئن شوید هدر ناخواسته به همهٔ فایل‌ها یا حتی صفحات HTML سرایت نکرده است.

اگر نمی‌دانید چرا فایل با وجود noindex هنوز در گزارش‌ها دیده می‌شود، ابتدا زمان آخرین خزش، پاسخ HTTP فعلی و دسترسی خزنده را بررسی کنید. حذف نتیجه ممکن است فوری نباشد. راهنمای robots.txt و محدودیت‌های آن کمک می‌کند تفاوت بستن خزش و جلوگیری از ایندکس را برای سایر نشانی‌ها نیز درست تشخیص دهید.

چک‌لیست آزمون پس از انتشار PDF

از نسخهٔ نهایی فایل یک نشانی عمومی بردارید و آن را بدون ورود به حساب باز کنید. متن یک صفحهٔ میانی را انتخاب و جست‌وجو کنید. عنوان Document Properties، نام فایل، زبان و نسخه را با موضوع واقعی سند مقایسه کنید. لینک‌های داخل فایل را در دسکتاپ و موبایل امتحان کنید و مطمئن شوید به نشانی درست می‌روند.

سپس هدرها را بخوانید: کد پاسخ، Content-Type و در صورت نیاز Link برای کنونیکال یا X-Robots-Tag برای noindex. تنظیمات را روی نشانی خود فایل بررسی کنید، نه فقط صفحه‌ای که دکمهٔ دانلود دارد. اگر فایل از CDN تحویل می‌شود، پاسخ CDN را با پاسخ مبدا مقایسه کنید تا هدرها در مسیر حذف یا تغییر نکرده باشند.

در صفحهٔ HTML میزبان، لینک دانلود با متن مشخص و توضیح کوتاه بگذارید. اگر سند نسخهٔ جدید گرفته است، لینک‌های داخلی به نسخهٔ قبلی را پیدا و اصلاح کنید. در پایان، نشانی فایل را در سرچ کنسول بررسی کنید و وضعیت خزش و ایندکس را با تصمیمی که برای آن سند گرفته‌اید مقایسه کنید. صرف باز شدن فایل در مرورگر به معنی حضور آن در گوگل نیست.

برای مجموعهٔ بزرگ PDF، یک جدول مدیریت داخلی بسازید که نشانی، عنوان، نوع سند، صفحهٔ میزبان، وضعیت ایندکس مطلوب، هدرهای لازم و تاریخ بازبینی را ثبت کند. این جدول برای خود تیم است و لازم نیست روی سایت منتشر شود. با آن می‌توان فایل‌های تکراری، نسخه‌های منسوخ و لینک‌های شکسته را پیش از تبدیل شدن به مسئلهٔ گسترده پیدا کرد.

جمع‌بندی

PDF وقتی برای جست‌وجو مفید است که سند واقعاً به نیاز کاربر پاسخ دهد و فایل عمومی سالمی باشد. متن قابل انتخاب، عنوان روشن، لینک از صفحهٔ مرتبط و پاسخ HTTP درست را پایه قرار دهید. اگر نسخهٔ HTML و PDF هم‌پوشانی دارند، نسخهٔ ترجیحی را با دلیل انتخاب و هدر کنونیکال را روی PDF تنظیم کنید؛ اگر فایل نباید در نتایج باشد، noindex را در X-Robots-Tag همان فایل بگذارید و نتیجه را بررسی کنید.

سوالات متداول

آیا نام فایل PDF برای سئو کافی است؟

خیر. نام معنادار به مدیریت و فهم موضوع کمک می‌کند، اما متن قابل جست‌وجو، عنوان سند، لینک‌های صفحهٔ میزبان و دسترسی HTTP نیز اهمیت دارند.

آیا باید هر PDF را به صفحهٔ HTML کنونیکال کنیم؟

خیر. وقتی دو نشانی محتوای عمدتاً یکسانی دارند، نسخهٔ ترجیحی را مشخص کنید. PDF مستقل و صفحهٔ معرفی کوتاه لزوماً محتوای تکراری نیستند.

برای PDF اسکن‌شده چه کاری لازم است؟

OCR را اجرا کنید و متن خروجی را نمونه‌گیری کنید. اگر کلمات، اعداد یا ترتیب خواندن خراب است، فایل را پیش از انتشار اصلاح کنید.

آیا بستن PDF در robots.txt همان noindex است؟

خیر. بستن خزش می‌تواند مانع دیدن هدر noindex شود. برای PDF عمومی که نباید در نتایج باشد، X-Robots-Tag را روی پاسخ فایل بگذارید و دسترسی خزنده را برای خواندن آن حفظ کنید.

منابع

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

شش − سه =

تماس مستقیم با مشاورین ما

جای شما در صفحه اول گوگل خالیست …

اگر می‌خواهید در نتایج گوگل دیده شوید، مشتریان بیشتری جذب کنید و از رقبا پیشی بگیرید، این فرم نقطه شروع شماست.

مشاورین ما پس از دریافت اطلاعات شما، به‌صورت اختصاصی وضعیت سایتتان را بررسی، رقبایتان را تحلیل کرده و مسیر واقعی رشدتان را طراحی می‌کند.

 این مشاوره کاملاً رایگان است، اما نتایج آن می‌تواند آینده کسب‌وکار شما را متحول کند.

ads-w
word50
لوگو گوگل
درخواست و بررسی سایت

فقط چند ثانیه زمان بگذارید، فرم زیر را با دقت پر کنید، و منتظر تماس مشاوران ما باشید.

لطفا خدمات مورد نظر خود را انتخاب کنید؟

هدف از سئو:

ساناز قمری
مشاور فروش