كيف تجعل ملف PDF الممسوح ضوئياً قابلاً للبحث
حُدِّث في 23 سبتمبر 2026
يبدو ملف PDF الممسوح ضوئياً كأنه نص، لكنه في الحقيقة مجموعة صور لصفحات، ولذلك لا يجد Ctrl+F شيئاً ولا يمكنك نسخ جملة منه. تقرأ تقنية OCR هذه الصور وتضيف فوقها طبقة نص غير مرئية، فتصبح الصفحات نفسها قابلة للبحث دون أن يتغير شكلها. يوضح هذا الدليل كيف تعرف أنك تحتاجها، وكيف تشغّلها داخل المتصفح، وكيف تحصل على نتائج أفضل.
أولاً: تأكد أن الملف يحتاج فعلاً إلى OCR
افتح الملف وحاول تحديد كلمة بالفأرة، ثم اضغط Ctrl+F وابحث عن كلمة تراها في الصفحة. إذا ظُلّلت الكلمة فالملف يحتوي طبقة نص ولا يحتاج إلى OCR. وإذا تعذّر تحديد أي شيء أو العثور عليه فالصفحات صور.
تعطيك أداة معلومات PDF رأياً ثانياً: المستند المكوّن من مسوحات ضوئية لا يعرض عادة أي خطوط ويُظهر وجود صور مضمّنة، بينما يعرض ملف PDF النصي خطوطه. وبعض الملفات تجمع النوعين، صفحات نصية وأخرى ممسوحة، ولهذا تتضمن أداة OCR خياراً لتخطي الصفحات التي تحتوي نصاً بالفعل.
ما هو ملف PDF القابل للبحث
يحتفظ ملف PDF القابل للبحث بصورة الصفحة الأصلية ويضع خلفها أو فوقها طبقة غير مرئية من النص المُتعرَّف عليه، محاذية للكلمات. تبقى ترى المسح الضوئي بأختامه وتواقيعه وكتابته اليدوية، لكن البحث والتحديد والنسخ تعمل لأن طبقة النص موجودة.
جودة النص من جودة التعرف. الحرف الذي قُرئ خطأ لا يظهر على الشاشة لكنه يجعل تلك الكلمة غير قابلة للعثور، ولهذا تهم جودة المصدر كثيراً.
جهّز المسح الضوئي لنتيجة أفضل
معظم أخطاء OCR سببها الصورة لا البرنامج. تصحيحات بسيطة قبل البدء توفر وقتاً كبيراً بعد ذلك.
- امسح بدقة 300 DPI. وتحت نحو 200 DPI تفقد الحروف الصغيرة التفاصيل التي يحتاجها OCR.
- أبقِ الصفحات مستقيمة. الصفحة المائلة تعطي أسطراً ملتوية يصعب قراءتها.
- اعتنِ بالتباين: نص داكن على خلفية فاتحة، دون ظل من كعب الكتاب ودون أصابع في الإطار.
- تجنب الضغط الشديد والصور منخفضة الدقة جداً للمستندات.
- إذا كنت ما تزال تلتقط الصفحات، فأداة مسح ضوئي إلى PDF تبني الملف من صورك بالترتيب الصحيح.
شغّل أداة OCR PDF في متصفحك
تعمل أداة التعرف الضوئي على PDF (OCR) بمحرك Tesseract.js، فتُعرض الصفحات وتُقرأ وتُعاد بناؤها على جهازك دون رفع مستنداتك. في أول استخدام يُنزَّل محرك OCR وبيانات اللغة مرة واحدة من شبكة CDN عامة، وحجمها بضعة ميغابايت.
- افتح أداة OCR PDF وأضف ملف PDF الممسوح ضوئياً (تُقبل أيضاً صور JPG وPNG).
- اختر لغة المستند. يمكنك اختيار عدة لغات إذا كانت الصفحة تخلط بينها، مثل الإنجليزية والفرنسية.
- اختر الدقة، 200 أو 300 DPI. استخدم 300 للخط الصغير و200 لإنهاء العمل أسرع.
- أبقِ خيار تخطي الصفحات التي تحتوي نصاً بالفعل إذا كان الملف مختلطاً.
- اختر الناتج: PDF قابل للبحث أو ملف نص عادي أو كليهما، ثم ابدأ.
حدود اللغات والأبجديات
اللغات المتاحة هي الإنجليزية والفرنسية والإسبانية والعربية والألمانية والإيطالية والبرتغالية والهولندية والتركية والروسية. اختيار لغة خاطئة أسرع طريق إلى نتيجة رديئة، لأن المحرك يطابق الأشكال مع أبجدية تلك اللغة.
تدعم طبقة النص غير المرئية داخل ملف PDF القابل للبحث اللغات المكتوبة بالحروف اللاتينية. أما العربية والروسية فتقدم لك الأداة النص المُتعرَّف عليه في ملف txt للتنزيل، ولا تتوفر طبقة PDF القابل للبحث لهاتين الكتابتين. والخط اليدوي لا يُتعرَّف عليه بموثوقية في أي لغة.
السرعة والحجم وما تتوقعه
OCR بطيء مقارنة بمعظم مهام PDF. توقع عدة ثوانٍ لكل صفحة على حاسوب محمول وأكثر على الهاتف، فقد يستغرق كتاب من 200 صفحة وقتاً. أبقِ علامة التبويب مفتوحة أثناء العمل، وجرّب بضع صفحات أولاً للتأكد من الإعدادات قبل معالجة المستند كله.
بما أن صورة الصفحة تبقى، فالنتيجة ليست ملفاً أصغر. وإذا كان كبيراً جداً للإرسال فيمكن لأداة ضغط PDF تصغيره بعد ذلك، ويستحسن أن تتأكد من أن البحث ما زال يعمل بعد الضغط.
تحقق من النتيجة
افتح ملف PDF الجديد واضغط Ctrl+F وابحث عن ثلاث كلمات: واحدة من الصفحة الأولى وأخرى من المنتصف وثالثة من النهاية. جرّب أيضاً كلمة فيها تشكيل أو رقماً، فهذه هي الحروف التي يخلط OCR بينها أكثر، مثل 0 وO أو 1 وl.
إذا كنت تحتاج الكلمات دون التنسيق فأداة PDF إلى نص تستخرج طبقة النص إلى ملف txt. وإذا كان المستند يحتاج إلى تعديل فشغّل OCR أولاً ثم PDF إلى Word، لأن التحويل إلى Word لا يجد ما يقرؤه في صفحة ممسوحة ضوئياً.
الأسئلة الشائعة
كيف أعرف أن ملف PDF الخاص بي ممسوح ضوئياً؟
حاول تحديد كلمة بالفأرة أو البحث بـ Ctrl+F. إذا تعذّر تحديد أي شيء أو العثور عليه فالصفحات صور وتحتاج إلى OCR. وتُظهر أداة معلومات PDF أيضاً ما إذا كان الملف يعرض خطوطاً وصوراً مضمّنة.
هل يغيّر OCR شكل الصفحات؟
لا. في ملف PDF القابل للبحث تبقى صورة الصفحة الأصلية كما هي ويُضاف النص المُتعرَّف عليه كطبقة غير مرئية. تبدو الصفحات كما كانت، لكن البحث والنسخ يعملان.
لماذا تحتوي نتيجة OCR على أخطاء كثيرة؟
السبب غالباً هو المسح الضوئي: دقة منخفضة أو صفحات مائلة أو نص باهت أو لغة خاطئة. أعد المسح بدقة 300 DPI وتباين جيد، واختر اللغة الصحيحة وحاول مجدداً. والخط اليدوي لا يُتعرَّف عليه بموثوقية.
هل تُرفع مستنداتي إلى خادم لإجراء OCR؟
لا. تعمل أداة OCR PDF داخل متصفحك ولا تُرفع المستندات أبداً. يُنزَّل فقط محرك OCR وملفات اللغة مرة واحدة من شبكة CDN عامة عند أول استخدام للأداة.
الأدوات المذكورة في هذا الدليل
المزيد من الأدلة
- ما هو OCR وكيف يعمل؟تقنية OCR تحوّل صور النصوص إلى نص حقيقي قابل للبحث. تعرّف على طريقة عملها خطوة بخطوة، وما يؤثر في دقتها، وحدودها مع الخط اليدوي، وما تنتجه.
- كيفية مسح المستندات ضوئياً إلى PDFحوّل الورق إلى PDF نظيف بكاميرا الهاتف أو الماسح الضوئي: نصائح الإضاءة والتأطير، وترتيب الصفحات، ومرشح المستند، والحجم، وإضافة نص قابل للبحث.