أدواتي.

استخراج نص من PDF (OCR)

ارفع ملف PDF ممسوح ضوئيًا أو يحتوي صور، واستخرج النص منه بالعربي أو الإنجليزي أو كلاهما — كل المعالجة داخل متصفحك.

استخراج نص من pdfpdf ocr عربيتحويل pdf ممسوح لنص

🔒 كل المعالجة تصير داخل متصفحك — ملفك لا يُرفع لأي سيرفر. تحميل محرك OCR أول مرة قد يأخذ دقيقة حسب سرعة اتصالك، والمعالجة تكون أبطأ نسبيًا للملفات الكبيرة أو متعددة الصفحات.

دليل استخراج النص من ملفات PDF الممسوحة ضوئيًا

إذا حاولت يومًا تحديد نص في ملف PDF ولم تستطع، فغالبًا الملف عبارة عن صور لصفحات ممسوحة ضوئيًا أو ملتقطة بكاميرا الهاتف، وليس نصًا حقيقيًا. هذا شائع في الكتب القديمة والعقود الموقعة والخطابات الرسمية المؤرشفة. هنا يأتي دور التعرف الضوئي على الحروف (OCR): تقرأ الأداة صورة كل صفحة وتحوّل ما فيها من حروف إلى نص يمكنك نسخه وتعديله والبحث فيه.

تعمل الأداة بالكامل داخل متصفحك باستخدام محرك Tesseract. في أول استخدام يُحمَّل المحرك وبيانات اللغة المختارة من الإنترنت، ثم تُرسم كل صفحة من ملفك كصورة عالية الدقة ويُقرأ نصها على جهازك، دون إرسال ملفك إلى أي خادم.

قبل البدء، تأكد أن ملفك يحتاج فعلًا إلى OCR: افتحه وحاول تحديد كلمة بالمؤشر. إذا أمكن تحديد النص فالملف يحتوي طبقة نصية، واستخراجها بأدوات التحويل العادية أسرع وأدق. أما إذا تصرفت الصفحة كصورة واحدة لا يمكن تحديد شيء منها، فهذه الأداة هي المناسبة.

خطوات الاستخدام

  1. اسحب ملف PDF إلى مربع اسحب ملف PDF هنا أو اضغط لاختياره.
  2. من قائمة لغة النص اختر: إنجليزي، أو عربي، أو إنجليزي + عربي.
  3. اضغط زر استخراج النص.
  4. تابع شريط التقدم والرسائل التي توضح الصفحة الجاري التعرف عليها، مثل "جاري التعرف على الصفحة 3 من 10".
  5. عند الانتهاء يظهر النص في مربع أسفل الأداة، مقسمًا بعناوين مثل "--- صفحة 1 ---".
  6. اضغط نسخ النص لنسخه إلى الحافظة، أو تحميل كملف .txt لحفظه باسم extracted-text.txt.

ما الذي توفره الأداة؟

  • ثلاثة خيارات للغة تناسب المستندات العربية والإنجليزية والمختلطة.
  • معالجة كل صفحات الملف بالترتيب مع فاصل واضح بين كل صفحة وأخرى.
  • شريط تقدم يوضح سير العملية في الملفات الطويلة.
  • نتيجة بنص عادي قابل للنسخ أو التحميل كملف نصي.

حالات استخدام عملية

  • استخراج نص عقد إيجار ممسوح ضوئيًا لاقتباس بند معين منه في رسالة.
  • تحويل صفحات من كتاب قديم مصوّر إلى نص لإعداد ملخص أو بحث.
  • نسخ بيانات خطاب رسمي مؤرشف بدل إعادة كتابته يدويًا.
  • تحويل ملاحظات محاضرة مطبوعة صوّرها الطالب إلى نص يمكن البحث فيه.

نصائح لنتائج أدق

  • اختر لغة واحدة إذا كان المستند بلغة واحدة؛ فهذا أسرع وغالبًا أدق. استخدم خيار إنجليزي + عربي للمستندات المختلطة فقط.
  • جودة النتيجة تعتمد على وضوح المسح: الصفحات المستقيمة جيدة الإضاءة ذات الخط المطبوع الواضح تعطي أفضل النتائج، أما الكتابة اليدوية والخطوط الزخرفية فنتائجها ضعيفة.
  • راجع النص العربي بعناية، خاصة مع التشكيل أو الخطوط الصغيرة، فقد تظهر أخطاء في بعض الحروف.
  • إذا كانت الصفحات مقلوبة أو مائلة فدوّرها أولًا قبل الاستخراج.
  • الملفات الطويلة تستغرق وقتًا لأن كل صفحة تُعالج على جهازك، فإن كنت تحتاج صفحات محددة فاستخرجها أولًا في ملف أصغر.
  • الأداة تعطيك نصًا فقط، ولا تنشئ ملف PDF جديدًا قابلًا للبحث.

إذا كان النص صورة منفردة وليس ملف PDF فاستخدم استخراج نص من صورة (OCR)، وإذا كان ملفك يحتوي نصًا قابلًا للتحديد أصلًا فالأسرع تحويل PDF إلى Word، ولتصحيح اتجاه الصفحات قبل الاستخراج استخدم تدوير صفحات PDF.

الأسئلة الشائعة

هل الأداة تدعم الملفات العربية؟

نعم، تقدر تختار اللغة العربية أو الإنجليزية أو كلاهما معًا قبل بدء الاستخراج، حسب لغة النص بملفك.

ليش المعالجة بطيئة شوي؟

الأداة تحمّل محرك OCR كامل (Tesseract) وتشغّله داخل متصفحك — هذا يحتاج وقتًا أطول من معالجة سيرفر مخصص، خصوصًا للملفات الكبيرة أو متعددة الصفحات، لكن ملفك يبقى خاصًا بالكامل.

هل ملفي يُرفع لأي سيرفر؟

لا إطلاقًا، التعرف على النص يصير بالكامل داخل متصفحك؛ الملف الوحيد اللي يتحمّل هو محرك OCR نفسه (ملفات عامة، لا علاقة لها بملفك الشخصي).

هل تنشئ الأداة ملف PDF قابلًا للبحث؟

لا، الأداة تستخرج النص وتعرضه لتنسخه أو تحمّله كملف .txt، ولا تعدّل ملف PDF الأصلي.

هل تتعرف الأداة على الكتابة اليدوية؟

المحرك مصمم أساسًا للنصوص المطبوعة، لذلك تكون نتائجه مع الكتابة اليدوية ضعيفة في الغالب.

أي خيار لغة أختار لمستند فيه عربي وإنجليزي؟

اختر إنجليزي + عربي ليتعرف المحرك على اللغتين معًا. أما إذا كان المستند بلغة واحدة فاختر تلك اللغة وحدها لنتيجة أسرع.

هل أحتاج إلى اتصال بالإنترنت؟

نعم عند أول استخدام لكل لغة، لتحميل محرك التعرف وبيانات اللغة، أما ملفك نفسه فيُعالج على جهازك.