چرا متن PDF بعد از کپی بههمریخته میشود؛ مشکل فونت است یا OCR؟
متن فارسی داخل PDF روی صفحه درست دیده میشود اما بعد از Copy/Paste حروف جدا، معکوس یا کاملاً نامفهوم میشوند.
اگر متن قابل انتخاب است ولی حروف جابهجا یا بیمعنی Paste میشوند، لایه متنی PDF احتمالاً نگاشت درستی ندارد؛ اگر اصلاً متن انتخاب نمیشود، به OCR نیاز دارید.
مرحلهبهمرحله
- یک جمله کوتاه را انتخاب و در یک ویرایشگر ساده Paste کنید؛ اگر ترتیب یا حروف خراب است، مشکل از لایه متنی یا نگاشت فونت PDF است نه مقصد Paste.
- همان عبارت را با جستوجوی داخل PDF امتحان کنید. اگر جستوجو هم نتیجه درست نمیدهد، لایه متن قابل اتکا نیست.
- اگر هیچ کلمهای انتخاب نمیشود، صفحه احتمالاً تصویر است؛ روی یک کپی از فایل OCR اجرا کنید و بعد چند واژه فارسی را دوباره جستوجو و Paste کنید.
- اگر متن انتخاب میشود اما خراب Paste میشود، بازکردن فایل در PDF Reader دیگری را امتحان کنید؛ اگر نتیجه یکسان است، باید متن را با OCR یا نسخه منبع سالمتر بازسازی کنید.
- بعد از OCR، اعداد، نامها و حروف مشابه فارسی/عربی را نمونهگیری کنید؛ خروجی OCR را بدون بازبینی برای متن حساس استفاده نکنید.
چرا این کار جواب میدهد؟
آنچه روی صفحه میبینید میتواند از glyphهای فونت ساخته شده باشد، در حالی که نگاشت Unicode پشت آن ناقص یا اشتباه است. PDF اسکنشده هم ممکن است اصلاً لایه متن نداشته باشد.
