فایل و PDF · حدود 4 دقیقه

چرا متن PDF بعد از کپی به‌هم‌ریخته می‌شود؛ مشکل فونت است یا OCR؟

متن فارسی داخل PDF روی صفحه درست دیده می‌شود اما بعد از Copy/Paste حروف جدا، معکوس یا کاملاً نامفهوم می‌شوند.

اگر عجله داری

اگر متن قابل انتخاب است ولی حروف جابه‌جا یا بی‌معنی Paste می‌شوند، لایه متنی PDF احتمالاً نگاشت درستی ندارد؛ اگر اصلاً متن انتخاب نمی‌شود، به OCR نیاز دارید.

مرحله‌به‌مرحله

  1. یک جمله کوتاه را انتخاب و در یک ویرایشگر ساده Paste کنید؛ اگر ترتیب یا حروف خراب است، مشکل از لایه متنی یا نگاشت فونت PDF است نه مقصد Paste.
  2. همان عبارت را با جست‌وجوی داخل PDF امتحان کنید. اگر جست‌وجو هم نتیجه درست نمی‌دهد، لایه متن قابل اتکا نیست.
  3. اگر هیچ کلمه‌ای انتخاب نمی‌شود، صفحه احتمالاً تصویر است؛ روی یک کپی از فایل OCR اجرا کنید و بعد چند واژه فارسی را دوباره جست‌وجو و Paste کنید.
  4. اگر متن انتخاب می‌شود اما خراب Paste می‌شود، بازکردن فایل در PDF Reader دیگری را امتحان کنید؛ اگر نتیجه یکسان است، باید متن را با OCR یا نسخه منبع سالم‌تر بازسازی کنید.
  5. بعد از OCR، اعداد، نام‌ها و حروف مشابه فارسی/عربی را نمونه‌گیری کنید؛ خروجی OCR را بدون بازبینی برای متن حساس استفاده نکنید.

چرا این کار جواب می‌دهد؟

آنچه روی صفحه می‌بینید می‌تواند از glyphهای فونت ساخته شده باشد، در حالی که نگاشت Unicode پشت آن ناقص یا اشتباه است. PDF اسکن‌شده هم ممکن است اصلاً لایه متن نداشته باشد.