تحويل ملف PDF ممسوح ضوئيًا إلى نص قابل للبحث
المسح الضوئي مجرد صورة للصفحة، فلا يمكنك البحث فيه ولا نسخ كلمة منه. يقرأ OCR الصورة وتنزّل ملف PDF قابلًا للبحث أو ملفًا نصيًا أو كليهما.
- الملفات لا تغادر متصفحك أبدًا.
- بلا حاجة إلى حساب
- بلا علامة مائية
- يعمل على أي جهاز
كيف تعمل
الخطوة 1: اختر ملف PDF ممسوحًا ضوئيًا أو صورة JPG أو PNG، أو أفلته هنا.
الخطوة 2: حدد لغة أو أكثر تطابق النص، ثم المخرج: PDF قابل للبحث أو ملف نصي أو كليهما.
الخطوة 3: اختر هل تُتجاوز الصفحات التي فيها نص أصلًا، وحدد دقة 200 أو 300 DPI.
الخطوة 4: اضغط على التعرف الضوئي، وانتظر معالجة كل صفحة، ثم نزّل النتيجة.
ماذا يفعل OCR بمستند ممسوح ضوئيًا
OCR اختصار التعرف الضوئي على الحروف. تُرسم كل صفحة كصورة، ثم يقرأ محرك التعرف (Tesseract.js الذي يعمل بتقنية WebAssembly داخل متصفحك) الحروف فيها، ويُسجَّل النص مع موضع كل كلمة في الصفحة. وفي ملف PDF القابل للبحث يوضع هذا النص بصورة غير مرئية خلف صورة الصفحة الأصلية، فتبدو الصفحة كما هي لكن يمكنك البحث فيها وتحديدها ونسخ مقاطع منها.
ويمكنك أيضًا تنزيل النص المتعرَّف عليه كملف txt عادي، وهو مناسب للصقه في محرر أو تمريره إلى أداة أخرى. تختار أولًا اللغات، ثم تحدد هل تُتجاوز الصفحات التي فيها نص أصلًا، ودقة رسم الصفحات (200 أو 300 DPI). وإلى جانب PDF تقبل الأداة صور JPG وPNG مدخلًا.
لا تُرفع مستنداتك أبدًا. الشيء الوحيد الذي يُجلب عبر الشبكة هو محرك OCR وبيانات اللغات، ويُنزَّلان من شبكة توصيل محتوى عامة (jsDelivr) أول مرة تستخدم فيها الأداة، وحجمهما بضعة ميغابايتات. ترى هذه الشبكة عنوان IP الخاص بك وترويسات الطلب المعتادة، لكنها لا ترى مستنداتك.
لماذا تستخدم هذه الأداة
مستنداتك لا تُرفع
يتم التعرف داخل متصفحك. يُنزَّل المحرك وملفات اللغات مرة واحدة فقط من شبكة توصيل عامة، أما صفحاتك فلا تغادر جهازك.
قابل للبحث والتحديد
مع اللغات ذات الأبجدية اللاتينية تحصل على PDF يعمل فيه البحث بـ Ctrl+F ويمكن تحديد فقرة ونسخها مع بقاء مظهر الصفحة الأصلي.
عشر لغات ويمكن الجمع بينها
تتوفر الإنجليزية والفرنسية والإسبانية والعربية والألمانية والإيطالية والبرتغالية والهولندية والتركية والروسية، ويمكنك اختيار عدة لغات للصفحات ثنائية اللغة.
يتجاوز ما فيه نص أصلًا
في ملف يمزج المسح الضوئي بصفحات رقمية يمكنك ترك الصفحات التي فيها نص كما هي، فتوفّر وقتًا.
استخدامات شائعة
البحث في أرشيف رسائل قديمة ممسوحة
لدى مكتب صغير أو أسرة مئات الملفات الممسوحة المسماة بالتاريخ فقط. بعد OCR تبحث عن اسم عائلة في كل النتائج بدل فتح كل ملف.
نسخ مقطع من فصل كتاب ممسوح
تصوّر طالبة فصلًا في المكتبة وتحتاج اقتباسًا. يحوّله OCR إلى نص يمكن لصقه في بحثها ومراجعته بعد ذلك.
استخراج نص مستند بالعربية أو الروسية
مع هاتين الأبجديتين تقدّم الأداة النص المتعرَّف عليه بصيغة txt، فيمكن نقل عقد أو إشعار ممسوح إلى محرر أو ترجمته.
تجهيز مسح ضوئي لأداة أخرى
تقرأ أدوات PDF إلى Word وPDF إلى Excel وPDF إلى نص ومقارنة PDF النصوص ولا تجد شيئًا في المسح الضوئي. مرّر الملف أولًا على التعرف الضوئي على PDF لتمنحها ما تعمل عليه.
رقمنة الإيصالات والفواتير
مستقل لديه صورة إيصال في هاتفه يستخدم ملف JPG مدخلًا ويحصل على نص ينسخ منه المبالغ والتواريخ.
الصفحات الممسوحة مقابل الصفحات التي فيها نص أصلًا
ليس كل ملف PDF بحاجة إلى OCR. فالملف المُصدَّر من معالج نصوص يحتوي نصًا حقيقيًا أصلًا، وتشغيل OCR عليه لن يزيد إلا العمل واحتمال الأخطاء الصغيرة. أما المسح الضوئي فلا يحتوي إلا صورًا. واختبار سريع: افتح الملف وحاول تحديد كلمة بالمؤشر. إن لم يظهر تحديد أو لم يجد Ctrl+F شيئًا فالصفحات صور.
والملفات المختلطة شائعة، كعقد رقمي فيه بضع صفحات توقيع ممسوحة. ويعالجها خيار تجاوز الصفحات التي فيها نص أصلًا: تبقى الصفحات الرقمية دون مساس وتُعالَج الممسوحة فقط. وبعد ذلك يعمل PDF القابل للبحث مع كل أدوات النص، فيمكنك المتابعة بضغط PDF أو PDF إلى Word أو PDF إلى نص بنتائج مفيدة.
- اختبر أولًا: إن استطعت تحديد النص فالصفحة ليست مسحًا ضوئيًا.
- استخدم خيار التجاوز مع المستندات المختلطة.
- ابحث بعد ذلك عن كلمة مميزة لتتأكد من النتيجة.
اختيار اللغات وفهم الأبجديات
يقرأ المحرك أفضل حين يعرف ما يتوقعه، فاختر لغة النص لا لغتك أنت فحسب. وإن مزجت الصفحة بين الفرنسية والإنجليزية فاختر الاثنتين؛ يستغرق التعرف وقتًا أطول قليلًا لكنه يكف عن اعتبار علامات إحدى اللغتين ضجيجًا. أما اختيار لغات كثيرة لا تحتاجها فيبطئ العملية وقد يسبب أخطاء قراءة، فاختر ما هو موجود في الصفحة فقط.
وثمة فرق مهم بين الأبجديات. فمع اللغات ذات الأبجدية اللاتينية (الإنجليزية والفرنسية والإسبانية والألمانية والإيطالية والبرتغالية والهولندية والتركية) تستطيع الأداة بناء PDF قابل للبحث تقع طبقة نصه غير المرئية خلف صورة الصفحة. أما العربية والروسية اللتان تستخدمان أبجديتين أخريين فهذه الطبقة القابلة للبحث غير متاحة في هذه الأداة. هي تتعرف عليهما لكنها تقدّم النتيجة كملف txt. فإن احتجت إلى PDF عربي قابل للبحث فلن تنتجه هذه الأداة.
- صفحة ثنائية اللغة: اختر اللغتين معًا.
- العربية أو الروسية: استخدم تنزيل txt.
- الأرقام والتواريخ والأسماء اللاتينية داخل صفحة عربية يُفضَّل مراجعتها بالعين.
كيف تحصل على أدق نتيجة
جودة الصورة أهم من أي إعداد. أوثق مدخل هو صفحة ممسوحة بدقة 300 DPI، مستقيمة على الزجاج، بإضاءة متساوية، ونص داكن على خلفية فاتحة. الصور المائلة والظلال والتجعّدات والحبر الباهت والخط الصغير جدًا كلها تقلل الدقة. وإن صوّرت صفحة بالهاتف فأمسكه موازيًا للورقة وتجنب ظلك واملأ الإطار بالصفحة.
استخدم 300 DPI للخط الصغير والحواشي والصفحات الكثيفة، و200 DPI حين يكون النص كبيرًا وتريد سرعة أكبر. والدقة الأعلى تعني ذاكرة ووقتًا أكثر لكل صفحة. أما الجداول والتنسيقات متعددة الأعمدة فتُقرأ سطرًا سطرًا، فقد لا يطابق ترتيب النص التنسيق البصري؛ فراجع هذه المواضع بالعين.
- امسح بدقة 300 DPI أو أعلى متى أمكن.
- قوّم الصفحات المائلة واقتطعها قبل OCR.
- لا تتوقع تعرفًا موثوقًا على الخط اليدوي.
- راجع الأسماء والأرقام والتواريخ بمقارنتها بالصفحة الأصلية.
الصيغ المدعومة
- المدخلات
- ملفات PDF (.pdf) وصور (.jpg و.jpeg و.png).
- المخرجات
- ملف PDF قابل للبحث (صورة الصفحة مع نص غير مرئي) و/أو ملف نصي txt عادي.
تغطي طبقة النص في PDF القابل للبحث اللغات ذات الأبجدية اللاتينية. أما العربية والروسية فيُقدَّم النص المتعرَّف عليه بصيغة txt.
من المفيد معرفته
- طبقة النص غير المرئية في PDF القابل للبحث تدعم اللغات ذات الأبجدية اللاتينية فقط. مع العربية والروسية تحصل على النص المتعرَّف عليه في ملف txt وليس PDF قابلًا للبحث.
- تعتمد الدقة على جودة المسح: تعطي الصفحات بدقة 300 DPI المستقيمة جيدة الإضاءة عالية التباين أفضل النتائج. ولا يُتعرَّف على الخط اليدوي بصورة موثوقة.
- التعرف بطيء مع المستندات الكبيرة: ثوانٍ لكل صفحة على حاسوب محمول وأكثر على الهاتف.
- أول استخدام ينزّل المحرك وبيانات اللغات من شبكة توصيل محتوى عامة (jsDelivr)، فيلزم اتصال بالإنترنت في تلك المرحلة.
- قد يخطئ التعرف، خصوصًا مع الخط الصغير والجداول والخطوط غير المألوفة، فراجع كل ما هو مهم.
ملفاتك لا تغادر متصفحك أبدًا
تعمل هذه الأداة بالكامل على جهازك داخل المتصفح. لا تُرفع ملفاتك إلى خوادمنا ولا تُخزَّن في أي مكان. وإغلاق التبويب يمحو كل شيء.
يُنزَّل محرك OCR وبيانات اللغة مرة واحدة من شبكة توصيل محتوى عامة عند أول استخدام. أما مستنداتك فلا تُرفع أبدًا.
الأسئلة الشائعة
هل تُرفع مستنداتي ليُتعرَّف عليها؟
لا. يعمل التعرف داخل متصفحك ولا تُرفع صفحاتك أبدًا. ويُنزَّل محرك OCR وملفات اللغات مرة واحدة من شبكة توصيل محتوى عامة (jsDelivr) ترى عنوان IP الخاص بك وترويسات الطلب المعتادة لكنها لا ترى مستنداتك.
ما اللغات التي تدعمها أداة OCR؟
الإنجليزية والفرنسية والإسبانية والعربية والألمانية والإيطالية والبرتغالية والهولندية والتركية والروسية. يمكنك اختيار لغة أو أكثر، مثلًا حين تمزج الصفحة بين لغتين.
هل أستطيع الحصول على PDF عربي قابل للبحث؟
لا. تعمل طبقة النص في PDF القابل للبحث مع اللغات ذات الأبجدية اللاتينية. أما مع العربية والروسية فتتعرف الأداة على النص لكنها تقدّمه بصيغة ملف txt فقط.
كم يستغرق التعرف الضوئي؟
توقّع بضع ثوانٍ لكل صفحة على حاسوب محمول وأكثر على الهاتف، فقد يستغرق مستند طويل عدة دقائق. ويستغرق التشغيل الأول وقتًا إضافيًا لتنزيل بيانات اللغات.
هل تتعرف الأداة على الخط اليدوي؟
ليس بصورة موثوقة. يعمل OCR أفضل مع النص المطبوع، أما الخط اليدوي فيخرج غالبًا بأخطاء كثيرة أو يُهمَل.
لماذا تحتوي النتيجة على أخطاء في بعض المواضع؟
غالبًا بسبب جودة الصورة: دقة منخفضة أو ميل أو ظلال أو حبر باهت أو خط لا يعرفه المحرك. أعد المسح بدقة 300 DPI، واختر اللغة الصحيحة وحاول مجددًا.
أدوات ذات صلة
أدلة ذات صلة
- كيف تجعل ملف PDF الممسوح ضوئياً قابلاً للبحثحوّل ملف PDF الممسوح ضوئياً إلى ملف قابل للبحث بتقنية OCR: كيف تعرف أنك تحتاجها، وإعدادات اللغة والدقة، وما تتوقعه، وكيف تتحقق من النتيجة.
- ما هو OCR وكيف يعمل؟تقنية OCR تحوّل صور النصوص إلى نص حقيقي قابل للبحث. تعرّف على طريقة عملها خطوة بخطوة، وما يؤثر في دقتها، وحدودها مع الخط اليدوي، وما تنتجه.
- كيفية مسح المستندات ضوئياً إلى PDFحوّل الورق إلى PDF نظيف بكاميرا الهاتف أو الماسح الضوئي: نصائح الإضاءة والتأطير، وترتيب الصفحات، ومرشح المستند، والحجم، وإضافة نص قابل للبحث.