MyPDF

لماذا تتشوه النصوص العربية عند النسخ من PDF؟ وكيف تستخرجها بشكل صحيح

هل تنسخ نصًا عربيًا من ملف PDF فيظهر معكوسًا أو بحروف مقطّعة؟ نشرح السبب الحقيقي — أشكال العرض والترتيب البصري — وكيف تستخرج النص العربي بشكل صحيح، ومتى تحتاج فعلًا إلى OCR.

قراءة في 7 دقائق

نسخت فقرة عربية من ملف PDF ولصقتها في Word أو في رسالة، فظهرت الكلمات معكوسة: «ابحرم» بدل «مرحبا»، أو ظهرت الحروف منفصلة عن بعضها، أو امتلأ النص برموز غريبة لا معنى لها. هذه ليست مشكلة في جهازك ولا في لوحة المفاتيح، بل هي واحدة من أشهر مشكلات التعامل مع العربية في ملفات PDF، ويواجهها الطلاب والموظفون والباحثون كل يوم.

في هذا المقال نشرح ببساطة ما الذي يحدث داخل الملف، ولماذا تتصرف العربية تحديدًا بهذه الطريقة، وكيف تميّز نوع المشكلة في ملفك، ثم كيف تستخرج النص بشكل صحيح — ومتى لا مفرّ من التعرّف الضوئي على الحروف (OCR).

ملف PDF لا يحفظ «نصًا» بل يرسم حروفًا

الفكرة الأهم التي تفسّر كل ما سيأتي: ملف PDF ليس مستندًا نصيًا مثل ملف Word. هو أقرب إلى مجموعة تعليمات رسم دقيقة: «ارسم الشكل رقم 312 من هذا الخط عند هذه النقطة من الصفحة»، ثم «ارسم الشكل رقم 87 بجانبه»، وهكذا. الهدف الأساسي لصيغة PDF أن يبدو الملف متطابقًا على كل الأجهزة، لا أن يكون النص بداخله سهل الاستخراج.

عندما تنسخ نصًا من الملف، يحاول البرنامج أن يعيد بناء الكلمات من هذه الأشكال المرسومة: يسأل كل شكل «أي حرف تمثّل؟» عبر جدول داخل الخط يُسمّى خريطة يونيكود (ToUnicode)، ثم يرتّب الحروف حسب مواقعها. في الإنجليزية تنجح هذه العملية غالبًا لأن الحروف منفصلة وتُكتب من اليسار إلى اليمين. أما العربية فتجتمع فيها ثلاث صعوبات دفعة واحدة: الحروف متصلة وتتغيّر أشكالها، والكتابة من اليمين إلى اليسار، والجمل قد تختلط بأرقام وكلمات لاتينية تسير في الاتجاه المعاكس.

المشكلة الأولى: أشكال العرض (Presentation Forms)

الحرف العربي الواحد قد يُكتب بأربعة أشكال: منفردًا، وفي أول الكلمة، وفي وسطها، وفي آخرها. حرف السين مثلًا يختلف شكله في «سلام» عنه في «درس».

في النص العربي السليم يُخزَّن الحرف مرة واحدة برمز واحد — السين هو الرمز U+0633 — وبرنامج العرض هو الذي يختار الشكل المناسب حسب موقع الحرف في الكلمة. لكن كثيرًا من برامج إنشاء PDF تحفظ الشكل المرسوم نفسه بدل الحرف الأصلي، فتربطه برموز من نطاق خاص في يونيكود اسمه «أشكال العرض العربية»، مثل U+FEB3 الذي يعني «سين في أول الكلمة».

النتيجة أن النص المنسوخ قد يبدو سليمًا للعين، لكنه في الحقيقة مكتوب برموز مختلفة عن الحروف العادية، فيحدث ما يلي:

  • البحث لا يعمل: تبحث عن كلمة «سلام» فلا يجدها البرنامج، لأن الحروف المخزّنة ليست الحروف التي كتبتها بلوحة المفاتيح.
  • التدقيق الإملائي يعدّ كل الكلمات أخطاء.
  • عند اللصق في برنامج آخر قد تظهر الحروف منفصلة أو بأشكال خاطئة، لأن كل حرف «مثبّت» على شكل واحد لا يتغيّر.
  • الربط «لا» قد يُحفظ رمزًا واحدًا (U+FEFB) بدل حرفين: لام ثم ألف، فتختفي الكلمة من نتائج البحث أو تنكسر عند التحرير.

الخبر الجيد أن هذه المشكلة قابلة للحل بطريقة منضبطة: يونيكود نفسه يعرّف لكل شكل عرض الحرفَ الأصلي الذي يقابله، فيمكن «تطبيع» النص وإرجاع كل شكل إلى حرفه الأساسي، وتفكيك الربطات مثل «لا» إلى حرفين.

المشكلة الثانية: الترتيب البصري بدل الترتيب المنطقي

يخزّن الحاسوب النص العربي بما يُسمّى الترتيب المنطقي: أول حرف تنطقه هو أول حرف في الذاكرة. كلمة «مرحبا» تُخزَّن ميمًا ثم راءً ثم حاءً، وعند العرض يتولّى البرنامج إظهارها من اليمين إلى اليسار.

بعض برامج إنشاء PDF — خصوصًا القديمة أو تلك التي لا تدعم العربية جيدًا — تتصرف بطريقة مختلفة: تقلب الحروف بنفسها قبل الحفظ، وترسمها على الصفحة من اليسار إلى اليمين بالترتيب الذي تراه العين، أي الترتيب البصري. تبدو الصفحة صحيحة تمامًا، لكن النص المخزّن يبدأ من آخر الكلمة. فإذا نسخته حصلت على «ابحرم» بدل «مرحبا»، وعلى جمل تبدأ من نهايتها.

ويزداد الأمر تعقيدًا حين تحتوي الجملة على أرقام أو كلمات إنجليزية، لأنها تُكتب من اليسار إلى اليمين حتى داخل النص العربي. فقد تجد العربي معكوسًا والأرقام سليمة، أو العكس، أو يظهر لك العام 2026 على صورة 6202.

إصلاح هذه المشكلة لا يكون بقلب النص كله قلبًا أعمى، بل بالاعتماد على مواقع الحروف على الصفحة: نجمع الحروف الواقعة على الارتفاع نفسه في سطر واحد، ثم نرتّبها من اليمين إلى اليسار حسب مواقعها الأفقية، مع الحفاظ على الأرقام والكلمات اللاتينية في اتجاهها الصحيح.

المشكلة الثالثة: المسافات والأعمدة والخطوط التالفة

هناك تفاصيل أخرى تُفسد النص المستخرج حتى لو حُلّت المشكلتان السابقتان:

  • المسافات غالبًا غير محفوظة: كثير من ملفات PDF لا تخزّن حرف المسافة أصلًا، بل تترك فراغًا بين الكلمات عند الرسم. على برنامج الاستخراج أن يستنتج مكان المسافة من حجم الفراغ، ولأن الحروف العربية متقاربة ومتصلة، قد تلتصق كلمتان أو تنقسم كلمة إلى جزأين.
  • الأعمدة: في الصفحات ذات العمودين، أو التي تضع العربية والإنجليزية متجاورتين على السطر نفسه، قد يقرأ البرنامج السطر من العمود الأيمن ثم يكمله مباشرة من الأيسر، فتختلط الجمل.
  • خريطة الخط التالفة: إذا لم يحتوِ الخط على جدول ToUnicode صحيح، فلا يعرف البرنامج أي حرف يمثّله كل شكل، فتحصل على رموز غريبة أو حروف لاتينية عشوائية. هنا لا يمكن إصلاح النص بالحساب، لأن المعلومة غير موجودة في الملف أصلًا.

المشكلة الرابعة: الملف صورة ممسوحة ضوئيًا

إذا كان الملف ناتجًا عن ماسح ضوئي أو تصوير بالجوال، فهو مجرد صور للصفحات لا تحتوي أي نص على الإطلاق. لا يمكنك تحديد الكلمات، وأي محاولة للنسخ لن تعطيك شيئًا. هذا النوع يحتاج إلى التعرف الضوئي على الحروف (OCR) الذي «يقرأ» الصورة ويحوّلها إلى نص.

كيف تعرف مشكلة ملفك؟

قبل أن تختار الحل، جرّب هذا الفحص السريع:

  1. حاول تحديد كلمة بالمؤشر. إن لم تستطع تحديد النص، فالملف صورة ويحتاج OCR.
  2. انسخ سطرًا والصقه. إن ظهرت الكلمات معكوسة، فالمشكلة في الترتيب البصري.
  3. ابحث داخل النص الملصوق عن كلمة تراها بعينك. إن لم يجدها البحث مع أنها ظاهرة، فالنص مخزّن بأشكال العرض.
  4. إن ظهرت رموز لا علاقة لها بالعربية، فخريطة الخط تالفة، والحل الموثوق هو OCR.
القاعدة الذهبية: إذا استطعت تحديد النص في الملف، فغالبًا يمكن استخراجه بشكل صحيح دون OCR. وإذا لم تستطع، فالملف صورة ويحتاج OCR.

كيف تستخرج النص العربي بشكل صحيح

صمّمنا أداة استخراج النص في MyPDFX لتعالج المشكلات الثلاث الأولى معًا، وهي تعمل بالكامل داخل متصفحك دون رفع الملف إلى أي خادم، فيبقى مستندك على جهازك. ما تفعله الأداة باختصار:

  • تقرأ كل شكل على الصفحة مع موقعه، بدل الاعتماد على الترتيب الذي خُزّن به داخل الملف.
  • تجمع الأشكال في أسطر حسب ارتفاعها، وترتّب كل سطر من اليمين إلى اليسار حسب مواقع الحروف، فيعود النص المعكوس إلى ترتيبه الصحيح.
  • تُرجع أشكال العرض إلى حروفها الأصلية وتفكّك الربطات مثل «لا»، فيعمل البحث والنسخ والتدقيق الإملائي كما ينبغي.
  • تستنتج المسافات من الفراغات بين الكلمات، وتفصل الأعمدة المتجاورة حتى لا تختلط الجمل.

الاستخدام بسيط: افتح الأداة، واختر ملف PDF، ثم انسخ النص الناتج أو نزّله. وبعد الاستخراج جرّب البحث عن كلمة عربية داخل النص؛ فإذا وجدها البحث، فأنت تتعامل الآن مع نص عربي حقيقي لا مع رسوم حروف.

متى تحتاج OCR؟

الأمانة تقتضي أن نقول: هناك ملفات لا ينفع معها الاستخراج المباشر مهما كانت جودة الأداة، لأن النص الصحيح غير موجود داخلها أصلًا. في هذه الحالات تحتاج OCR:

  • الملفات الممسوحة ضوئيًا أو المصوّرة بالجوال.
  • الملفات ذات خرائط الخطوط التالفة التي تعطي رموزًا غريبة.
  • الملفات التي يخرج نصها ناقصًا أو مشوّهًا بشكل لا يُصلحه الترتيب والتطبيع.

لهذا توفّر أداة استخراج النص خيار OCR بدقة أعلى يقرأ الصفحة كصورة ويتعرّف على الحروف العربية. هذا الخيار يعالج الملف على خوادمنا ثم يحذفه تلقائيًا، ويستهلك عملية واحدة من رصيدك. والـ OCR نفسه ليس سحرًا: راجع الأسماء والأرقام بعده، وتوقّع نتائج أضعف مع الخط اليدوي والصور الباهتة أو المائلة. وإن كان هدفك جدولًا، فالأفضل استخدام تحويل PDF إلى Excel الذي يحافظ على الصفوف والأعمدة بدل تحويلها إلى نص متصل.

نصائح سريعة

  • إن استطعت الحصول على الملف الأصلي (ملف Word مثلًا)، فهو دائمًا أفضل من استخراج النص من PDF.
  • لا تحكم على الملف من شكله على الشاشة؛ الشكل السليم لا يعني أن النص المخزّن سليم.
  • اختبر النص بعد الاستخراج بالبحث عن كلمة عربية قبل أن تعتمد عليه في عملك.
  • عندما تنشئ ملفات PDF بنفسك، صدّرها من برنامج يدعم العربية جيدًا واختر خطوطًا عربية حديثة، فهذا يجنّب من يستلم ملفك هذه المشكلات.

الخلاصة

تشوّه النص العربي عند النسخ من PDF له أسباب واضحة: حروف محفوظة بأشكال العرض بدل الحروف الأصلية، ونص مخزّن بالترتيب البصري لا المنطقي، ومسافات وأعمدة يجب استنتاجها، وأحيانًا ملف لا يحتوي نصًا أصلًا. المشكلات الثلاث الأولى يمكن إصلاحها بإعادة بناء النص من مواقع الحروف وتطبيعه، وهذا ما تفعله أداة استخراج النص داخل متصفحك مجانًا. أما الملفات الممسوحة أو التالفة فحلّها OCR — وعندها ستعرف أنك تستخدمه لأن الملف يحتاجه فعلًا، لا لأنه الخيار الوحيد الذي تعرفه.

لماذا تتشوه النصوص العربية عند النسخ من PDF؟ وكيف تستخرجها بشكل صحيح | MyPDFX