انتقل إلى المحتوى
PDFlora

التعرف الضوئي وأدوات النصوص لملفات PDF الممسوحة

يبدو ملف PDF الممسوح كمستند لكنه في الحقيقة مجموعة صور، فلا يمكنك البحث فيه أو تحديد كلماته أو تحويله إلى Word. يقرأ التعرف الضوئي (OCR) تلك الصور وينتج نصًا حقيقيًا. إليك كيف تعرف إن كنت بحاجة إليه، وما الأدوات المرتبطة التي تستخدمها قبله وبعده.

1 أداة

PDF ممسوح أم PDF نصي: كيف تفرّق بينهما

افتح الملف وحاول تحديد جملة بالفأرة أو ابحث عن كلمة تراها في الصفحة. فإذا ظُلّلت الكلمات ووجدها البحث فالملف يحوي طبقة نص ولا يحتاج إلى التعرف الضوئي. وإذا لم تستطع تحديد سوى الصفحة كلها ككتلة واحدة، أو لم يُعثر على شيء، فهو مسح ضوئي مكوّن من صور.

المستندات القادمة من الماسحات الضوئية وصور كاميرا الهاتف والملفات المحفوظة كصور ثم المحوّلة إلى PDF كلها مسوحات. أما ما يُصدَّر من Word أو صفحات الويب فهو غالبًا PDF نصي. وبعض الملفات يجمع النوعين، بصفحات ممسوحة قليلة داخل مستند نصي، ولذلك تتيح أداة التعرف الضوئي على PDF تخطي الصفحات التي تحوي نصًا أصلًا.

ماذا تنتج أداة OCR وكيف تحصل على نتائج جيدة

تصيّر أداة التعرف الضوئي على PDF كل صفحة كصورة وتتعرف على الحروف بمحرك Tesseract.js داخل متصفحك، وتنتج ملف PDF قابلًا للبحث (صورة الصفحة مع طبقة نص غير مرئية) وإن شئت ملفًا نصيًا عاديًا. وهي تقرأ الإنجليزية والفرنسية والإسبانية والعربية والألمانية والإيطالية والبرتغالية والهولندية والتركية والروسية، ويمكنك اختيار عدة لغات معًا للمستندات المختلطة. كما تقبل صور JPG وPNG مباشرة.

تعتمد الدقة أساسًا على جودة المسح. استهدف دقة 300 DPI وصفحات مستقيمة وتباينًا جيدًا وإضاءة نظيفة؛ فالصورة المائلة أو المظلّلة ستعطي أخطاء أكثر. ولا يُتعرَّف على الخط اليدوي بموثوقية. وبالنسبة إلى العربية والروسية توفر الأداة النص المتعرَّف عليه كملف ‎.txt للتنزيل لأن طبقة PDF القابلة للبحث غير متاحة لهاتين الكتابتين. توقّع ثوانيَ لكل صفحة على حاسوب محمول وأكثر على الهاتف.

  • اختر كل اللغات الموجودة في المستند لا اللغة الرئيسة وحدها.
  • استخدم 300 DPI للخط الصغير و200 DPI للصفحات النظيفة السريعة.
  • أعد مسح الصفحة الرديئة بدل أن تنتظر من OCR إصلاحها.
  • راجع الأسماء والأرقام والتواريخ، حيث يهم حرف واحد خاطئ.

أدوات تستخدمها قبل التعرف الضوئي وبعده

قبل التعرف الضوئي يمكن لأداتي مسح ضوئي إلى PDF والصور إلى PDF جمع الصور في ملف PDF واحد، ويصلح تدوير PDF الصفحات الممسوحة على جانبها لأن OCR يقرأ النص المستقيم أفضل. وبعده تستخرج أداة PDF إلى نص طبقة النص إلى ملف ‎.txt، وتعيد PDF إلى Word بناء مستند قابل للتعديل، وتعطي PDF إلى Markdown نصًا عاديًا منظمًا. وتجد أداة مقارنة PDF الفروق بين نسختين، لكنها كغيرها تعمل على نص حقيقي، فتحتاج الملفات الممسوحة إلى OCR أولًا.

تعمل أداة التعرف الضوئي على PDF داخل متصفحك ولا تُرفع مستنداتك أبدًا. أما محرك OCR وبيانات اللغة، وحجمها بضعة ميغابايت، فتُنزَّل مرة واحدة من شبكة توصيل محتوى عامة (jsDelivr) عند أول استخدام؛ وترى الشبكة عنوان IP الخاص بك لكنها لا ترى مستنداتك.

الأسئلة الشائعة

كيف أعرف إن كان ملف PDF الخاص بي يحتاج إلى OCR؟

جرّب تحديد نص أو البحث عن كلمة تراها. إذا لم يُظلَّل شيء أو لم يجد البحث شيئًا فالملف مسح ضوئي ويحتاج إلى OCR. وإذا حُدد النص بشكل طبيعي فهو يحوي طبقة نص أصلًا.

هل تُرفع مستنداتي عند تشغيل OCR؟

لا. يعمل التعرف داخل متصفحك. وعند أول استخدام يُنزَّل محرك OCR وملفات اللغة من شبكة توصيل محتوى عامة (jsDelivr) ترى عنوان IP الخاص بك لكنها لا ترى مستنداتك أبدًا.

هل يعمل OCR مع العربية والخط اليدوي؟

يُتعرَّف على العربية لكن النتيجة تُقدَّم كملف ‎.txt للتنزيل لأن طبقة النص في PDF القابل للبحث غير متاحة للعربية والروسية. أما الخط اليدوي فلا يُتعرَّف عليه بموثوقية؛ ويعطي OCR أفضل نتائجه مع النص المطبوع النظيف.

لماذا يبطؤ OCR مع ملفي؟

تُصيَّر كل صفحة كصورة وتُحلَّل على جهازك أنت، وهذا يستغرق ثوانيَ لكل صفحة على حاسوب محمول وأكثر على الهاتف. للمستندات الكبيرة استخدم حاسوبًا، واختر 200 DPI إذا كانت الطباعة واضحة، وأبقِ التبويب مفتوحًا.

ماذا أفعل بعد OCR لتعديل النص؟

استخدم PDF إلى Word لمستند قابل للتعديل، أو PDF إلى نص لنص عادي. راجع النتيجة أولًا لأن OCR قد يخطئ في قراءة بعض الحروف، خصوصًا في المسوحات الرديئة.