انتقل إلى المقال
الذكاء الاصطناعي

OCR عربي: لماذا يصعب تحويل PDF إلى وورد بدون أخطاء، وكيف تلتقط الأخطاء قبل أن تصل إلى أنظمتك

لماذا يتعثر OCR عربي في الأرقام والتواريخ والجداول، وكيف تقرأ نسب الدقة التي تعلنها الأدوات، وسير عمل من خمس خطوات مع جدول تقيس به نسبة الأخطاء على مستنداتك.

رسم كرتوني: الروبوت O-bot يحوّل كومة أوراق ممسوحة مجعّدة وملطخة إلى صفوف مرتبة من البطاقات عليها علامات صح.
صورة توضيحية: قد يحوّل OCR الصفحات الممسوحة الفوضوية إلى بيانات مرتبة، لكن لا يُعتمد ذلك إلا ضمن سير عمل يراجع الناتج.

أبرز النقاط

  • لا توجد أداة OCR تضمن نصًا عربيًا بلا أخطاء: الأخطاء تتركز في الأرقام والتواريخ والأسماء والجداول والكلمات الممدودة، فأبقِ مراجعة الموظف.
  • في اختبار KITAB-Bench (2025) سجّلت نماذج الذكاء الاصطناعي أخطاء حروف أقل من أدوات OCR التقليدية، لكن أفضلها لم يحقق إلا نحو 65% في تحويل ملفات PDF صعبة كاملة بجداولها.
  • افرز أولًا: النص الرقمي السليم وملف XML للفاتورة الإلكترونية وتصدير الأنظمة أدق من المسح، وإن تكسّرت العربية عند النسخ فجرّب أداة استخراج أخرى قبل OCR.
  • امسح بدقة 300 نقطة في البوصة على الأقل، بصفحات مستقيمة وبالألوان أو الرمادي، واستخرج حقولًا لها قواعد صيغة ومطابقة، وقِس نسبة الأخطاء على 50 مستندًا حقيقيًا.
  • احفظ الملف الممسوح دون تعديل ومربوطًا بكل سجل، ولا تصوّر الوثائق الرسمية للهوية أو تنسخها إلا بطلب جهة مختصة أو تنفيذًا لنظام (المادة 31 من اللائحة التنفيذية لنظام حماية البيانات الشخصية).
في هذه الصفحة
  1. لماذا يصعب التعرّف الضوئي على الحروف العربية؟
    1. كيف تُربك طبيعة الخط العربي أدوات OCR
    2. حل مشكلة الحروف العربية المتقطعة أو المعكوسة في PDF: ثلاثة أسباب محتملة
  2. ماذا وجد اختبار أكاديمي لأدوات OCR عربي عام 2025؟
    1. نماذج الذكاء الاصطناعي الأحدث مقابل أدوات التعرّف التقليدية
    2. أين تعثّر أفضل نموذج في الاختبار
    3. ما لم يشمله الاختبار: مستنداتك أنت
  3. الخطوة 1: هل يحتاج المستند إلى OCR أصلًا؟ افرز قبل المسح
  4. الخطوة 2: حسّن جودة المسح قبل أن تلوم البرنامج
  5. الخطوة 3: استخراج النصوص من PDF إلى حقول، لا إلى ملف وورد فقط
  6. الخطوة 4: مراجعة بشرية للأسماء والأرقام والتواريخ والمبالغ
  7. الخطوة 5: احتفظ بالأصل بجانب البيانات المستخرجة
    1. ماذا تشترط الأنظمة السعودية لحفظ السجلات الإلكترونية
    2. صور الهويات وأين تذهب بياناتك
  8. ابدأ بنوع واحد من المستندات وقِس نسبة الأخطاء
  9. خطوتك التالية

صارت أدوات التعرّف الضوئي على الحروف (OCR) تقرأ العربية بما يكفي لتوفّر عليك كثيرًا من إعادة إدخال النص يدويًا في ملفات PDF الممسوحة ضوئيًا، لكن نتيجتها لا تُعتمد دون مراجعة، ولا توجد أداة تضمن تحويل PDF إلى وورد بدون أخطاء.

وحين تستخدم أداة OCR عربي، تتركز الأخطاء غالبًا في الأرقام والتواريخ والأسماء والجداول والكلمات الممدودة، حيث يكلّفك الخطأ مالًا. والحل سير عمل من خمس خطوات: تفرز المستندات، وتحسّن المسح، وتستخرج الحقول، ويراجعها موظف، ويبقى الأصل بجانبها.

ويصلح سير العمل هذا في الرياض ودبي كما في مكتب بلندن تصله مستندات عربية.

لماذا يصعب التعرّف الضوئي على الحروف العربية؟

كيف تُربك طبيعة الخط العربي أدوات OCR

الحروف العربية متصلة، ويتغير شكل الحرف بحسب موضعه في الكلمة، وكثيرًا ما تُحذف الحركات في الكتابة اليومية، فيصعب على الأداة استعادة النص كما هو [1]. والنص يسير من اليمين إلى اليسار [2]، بينما تُكتب الأرقام والرموز اللاتينية في السطر نفسه من اليسار إلى اليمين. والنقاط وحدها تفرّق بين ب وت وث، فنقطة باهتة قد تبدّل الحرف.

ويضيف الباحثون في اختبار KITAB-Bench المعياري (Benchmark) أربعة مواضع تتعثر فيها الأدوات: الخطوط المعقدة، وقراءة الأرقام، وتطويل الكلمات (مدّ الحرف بالكشيدة لضبط طول السطر، كما في «جـــميل»)، والتعرّف على بنية الجداول [2].

حل مشكلة الحروف العربية المتقطعة أو المعكوسة في PDF: ثلاثة أسباب محتملة

حين يُفسد تحويل PDF إلى وورد النص العربي، فالسبب غالبًا واحد من ثلاثة:

  • ملف PDF ممسوح ضوئيًا: صورة للصفحة، لا يُنسخ منها شيء حتى يقرأها OCR.
  • ملف PDF رقمي بطبقة نص غير سليمة: تُخزَّن فيه العربية بأشكال العرض (شكل الحرف على الشاشة) أو بترتيب العرض بدل الحروف القياسية بترتيب القراءة، فيبدو النص سليمًا ثم يتكسّر عند النسخ أو البحث.
  • أداة استخراج تخطئ: طبقة النص سليمة، لكن الأداة تعيد ترتيب الحروف خطأً.

ويوضح اتحاد يونيكود (Unicode Consortium)، واضع معيار ترميز الحروف في الحواسيب، أن أشكال العرض العربية مرمَّزة للتوافق فقط، ولا يُنصح باستخدامها لأنها لا تضمن سلامة البيانات وقابليتها للتبادل بين الأنظمة [3، 4].

مثال من ملف رسمي: في اختبار لهذا المقال في 29 سبتمبر 2026، استُخرج نص «الدليل الإرشادي التفصيلي للفوترة الإلكترونية» الصادر عن هيئة الزكاة والضريبة والجمارك (ZATCA) بثلاث أدوات شائعة مفتوحة المصدر [5]. قلبت الأولى ترتيب اللام والألف في كل موضع: خرجت «خلال» بهذا الشكل «خالل» في مواضعها الـ36 كلها، ولم تسلم «لا» المنفردة في أي موضع، فخرجت جملة الدليل المقتبسة في الخطوة 1 «ولا تعتبر الفاتورة الورقية…» هكذا: «وال تعتبر الفاتورة الورقية…»، وضاع النفي.

أما الأداة الثانية فقرأت الملف نفسه سليمًا، وقلبت الثالثة أسطرًا كاملة، مع أن الملف يظهر سليمًا على الشاشة. اختبار سريع: ابحث في النص المستخرج عن «لا»؛ فإن غابت وهي بهذا الشيوع، فجرّب أداة أخرى قبل أن تحكم على الملف أو تلجأ إلى OCR.

ما تراهالسبب المرجّحأول ما تفعله
حروف متقطعة أو رموز غريبة عند اللصقطبقة النص تخزّن أشكال العرضحوّل النص إلى الحروف القياسية، أو شغّل OCR على صورة الصفحة
كلمات أو أزواج حروف معكوسة، مثل «خالل»خطأ في أداة الاستخراج، أو نص مخزّن بترتيب العرضجرّب أداة استخراج أخرى، ثم شغّل OCR على صورة الصفحة
أرقام في غير موضعها داخل الجملةاختلاط اتجاهي الكتابةطابِق الأرقام مع صورة الصفحة دائمًا
أعمدة جدول مُزاحة أو مدموجةخطأ في قراءة تخطيط الصفحةاستخرج الحقول، وأعد جمع الصفوف وقارنها بالمجموع المطبوع (الخطوة 3)

ماذا وجد اختبار أكاديمي لأدوات OCR عربي عام 2025؟

بنى اختبار KITAB-Bench باحثون من جامعة محمد بن زايد للذكاء الاصطناعي في أبوظبي وجهات شريكة، ونُشر ضمن أبحاث Findings of ACL 2025 المحكّمة، المصاحبة لمؤتمر رابطة اللغويات الحاسوبية. ويضم 8,809 عيّنات في 9 مجالات، منها الخط اليدوي والجداول والرسوم البيانية [2].

واختبر النماذج المتاحة في مطلع 2025، ثم وجدت ورقة لاحقة أخطاءً في النص المرجعي لاختبار ملفات PDF فيه [6]، فخذ نتائجه التالية مؤشرًا لا حكمًا نهائيًا.

نماذج الذكاء الاصطناعي الأحدث مقابل أدوات التعرّف التقليدية

تفوقت نماذج الرؤية واللغة، وهي نماذج ذكاء اصطناعي تقرأ صورة الصفحة وتفهم لغتها معًا، على أدوات OCR التقليدية بفارق متوسطه 60% في معدل الخطأ في الحروف (CER)، أي نسبة الحروف الخاطئة أو الناقصة أو الزائدة [2]. فالرقم يصف فرقًا في الخطأ، ولا يعني دقة بنسبة 60%. ولم يتصدر نموذج واحد في كل صعوبات العربية من خطوط وتشكيل وتطويل ونص مائل [2].

أين تعثّر أفضل نموذج في الاختبار

خصّ الباحثون بالذكر تحويل ملف PDF كامل إلى نص منسّق يحفظ الجداول، ولم يحقق فيه أفضل نموذج إلا نحو 65% [2]. وهذه النسبة لا تعني أن 65% من الكلمات صحيحة؛ إنها درجة مركّبة تجمع دقة النص ودقة بنية الجداول، وقيست على 33 ملفًا اختيرت عمدًا لصعوبتها، فيها جداول ملونة، وخلايا مدموجة، وعلامات مائية، وملاحظات بخط اليد.

ولهذا تقوم الخطوة 3 على استخراج حقول محددة. ولأن النماذج الحديثة أظهرت ضعفًا مع النص المائل [2]، تشدد الخطوة 2 على استقامة الصفحات عند المسح.

ما لم يشمله الاختبار: مستنداتك أنت

يقرّ الباحثون بأن الاختبار لا يغطي المستندات المؤسسية الممسوحة، كالسجلات التاريخية والحكومية والمالية، وبأن النماذج كثيرًا ما تعجز عن التعميم بين المجالات وتخطيطات الصفحات [2]. والفواتير والخطابات الحكومية هي تحديدًا هذا النوع من المستندات، والعقود قريبة منها. وكذلك أي خدمة لاستخراج النصوص من الصور بالذكاء الاصطناعي: نجاحها في صفحة نظيفة لا يضمن نجاحها في خطاب عليه ختم وتوقيع. فجرّب على ملفاتك أنت.

ستجد مواقع تعد بتحويل دقيق بنسبة 100%، وأخرى تعلن دقة 95% أو 99%. فاسأل قبل أن تصدّق أي نسبة:

السؤاللماذا يهم
1. دقة ماذا: الحروف، أم الكلمات، أم الحقول، أم المستند كاملًا؟99% في الحروف تعني نحو 20 خطأً في صفحة من 2,000 حرف، قد يكون أحدها في رقم هوية أو مبلغ
2. على أي مستندات: نص رقمي، أم مسح ضوئي، أم صور بالجوال، أم خط يد؟نتيجة الصفحة النظيفة لا تنتقل إلى صورة جوال مائلة
3. مستندات مَن: عيّنة المورّد أم مستنداتك؟الباحثون أنفسهم ينبّهون إلى ضعف التعميم [2]
4. هل تشمل الأرقام والتواريخ والجداول؟فيها تقع الأخطاء التي تكلّفك مالًا أو تُفوّت عليك موعدًا
5. ماذا يحدث للنتائج منخفضة الثقة: تُحال إلى موظف، أم تمر كما هي؟الخطأ الذي لا يُنبَّه إليه أحد يصل إلى أنظمتك

ولبقية أسئلة اختيار المورد، راجع 10 أسئلة قبل أن توقّع مع شركة برمجة.

الخطوة 1: هل يحتاج المستند إلى OCR أصلًا؟ افرز قبل المسح

بعض المستندات لا تحتاج إلى OCR أصلًا، فقبل أن تمسح شيئًا، صنّفها:

المستند الذي لديكالطريق الأنسبالسبب
ملف PDF رقمي يُنسخ نصه العربي سليمًااستخرج النص مباشرة، ثم وحّد صيغتهلن يضيف OCR هنا إلا أخطاء
ملف PDF رقمي تتكسر عربيته عند النسخجرّب أداة استخراج أخرى، ثم شغّل OCR على صورة الصفحةالخلل في طبقة النص أو في أداة الاستخراج
فاتورة ضريبية (بين منشأتين) من مورد سعودي مشمول بالمرحلة الثانيةاطلب ملف XML، أو ملف PDF/A-3 المضمَّن فيه XMLتشترط الهيئة هاتين الصيغتين لمشاركتها مع المشتري [5]
تقارير الأنظمة والبنوك والبوابات الإلكترونيةاطلب ملف CSV أو Excelأدق من قراءة نسخة مطبوعة
مستندات مطبوعة ممسوحة أو مصوّرةالخطوات من 2 إلى 5هذا ما صُمم له OCR
خط اليد أو الملفات القديمة التالفةاعتبر الناتج اقتراحًا، وراجع كل حقلللأعداد القليلة قد يكون الإدخال اليدوي أسرع

والمرحلة الثانية (الربط والتكامل) هي التي تُربط فيها أنظمة فوترة المنشآت بمنصة «فاتورة» التابعة للهيئة [5]. وينص الدليل على أنه «لا تعتبر الفاتورة الورقية التي حولت إلى صيغة إلكترونية من خلال النسخ أو المسح الضوئي أو أي طريقة أخرى بمثابة فاتورة إلكترونية مطابقة» [5]، فاطلب البيانات المنظمة من المورد.

ولا يناسب OCR كذلك المستندات النادرة التي تُقرأ مرة واحدة؛ فقراءة موظف لها أقل تكلفة من إعداد الاستخراج.

الخطوة 2: حسّن جودة المسح قبل أن تلوم البرنامج

جودة المسح هي الجزء الذي تتحكم فيه. وتستعين القائمة التالية بقواعد الإدارة الوطنية للأرشيف والسجلات في الولايات المتحدة (NARA) لرقمنة السجلات الورقية الفيدرالية الدائمة، مرجعًا للمقارنة لا متطلبًا سعوديًا [7].

يدا رجل مسنّ بكمّين أبيضين تُدخلان ورقة صفراء قديمة في ماسح ضوئي مضيء، وبجانبه رزمة أوراق مربوطة بخيط.
صورة توضيحية: جودة المسح هي الجزء الذي تتحكم فيه، فامسح أوضح نسخة لديك بالألوان أو بتدرجات الرمادي.
  • 300 نقطة في البوصة (dpi) على الأقل بمقاس المستند الأصلي، وهو الحد الأدنى في تلك القواعد [7].
  • بالألوان أو بتدرجات الرمادي، كما تنص تلك القواعد للسجلات الورقية الحديثة [7]؛ فالأبيض والأسود الصافي قد يُسقط الأختام الباهتة والتواقيع، بل ونقاط الحروف نفسها.
  • صفحات مستقيمة، مقصوصة الحواف الداكنة: فالنص المائل نقطة ضعف لدى النماذج الحديثة [2].
  • ملف واحد لكل مستند، بكل صفحاته مرتبة.
  • صور الجوال: مستند مسطّح، وإضاءة متجانسة بلا ظل، وصفحة كاملة دون أن تظهر الأصابع. والصورة الضبابية تُعاد ولا تُصلَح.
  • الأصل لا نسخة النسخة: امسح أوضح نسخة لديك، فكل نسخة عن نسخة تطمس النقاط أكثر.
  • افحص الناتج مع الإعدادات: افتح خمسة ملفات كل أسبوع بتكبير 100%.

الخطوة 3: استخراج النصوص من PDF إلى حقول، لا إلى ملف وورد فقط

ملف وورد يعطيك نصًا عليك أن تقرأه من جديد، أما الحقول فبيانات تراجعها وتبحث فيها وتجمعها وتُدخلها في أنظمتك.

واستخرج الحقول التي تحتاج إليها فقط، ولا تأخذ من البيانات الشخصية إلا ما يخدم الغرض. فنظام حماية البيانات الشخصية السعودي، الذي تشرف على تطبيقه الهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا)، يوجب أن يكون محتوى البيانات الشخصية «مقصوراً على الحد الأدنى اللازم لتحقيق الغرض من جمعها» [8، المادة 11، الفقرة 3].

وهذا جدول حقول لمثال افتراضي (عقد إيجار ممسوح ضوئيًا)، انسخه وعدّله:

الحقلمكانه في المستندقاعدة الصيغةيُطابَق معالمراجعة
اسم المستأجربيانات الأطرافبالعربية كما كُتب، دون تحويل آلي إلى حروف لاتينيةقائمة المستأجريندائمًا
رقم الهوية أو السجل التجاريبيانات الأطرافأرقام فقط، بنوع أرقام واحد، وبالطول المعتادقائمة المستأجرين أو السجل التجاريدائمًا
رقم الوحدةالبند الأولكما كُتبسجل الوحداتعيّنة
الإيجار بالأرقامبند الدفعالمبلغ بالأرقام مع رمز العملة (مثل SAR)الإيجار بالحروفدائمًا
تاريخا البداية والنهايةبند المدةالتاريخ كما كُتب + تقويمه + مقابله الميلاديكل منهما مع الآخر ومع مدة العقددائمًا
صفوف جدول الدفعاتجدول الدفعاتعدد الصفوف، وتاريخ ومبلغ لكل صفالمجموع المطبوعدائمًا (المجموع)
البنود غير المعتادةأي موضعلا تُستخرج، وتُحال الصفحة إلى موظفلا ينطبقيقرؤها موظف

ثم وحّد الصيغة:

  • الأرقام: يميّز معيار يونيكود ثلاث مجموعات من الأرقام: الأوروبية (123)، والعربية الهندية (١٢٣) التي يسميها كثيرون «الأرقام الهندية»، والعربية الهندية الشرقية (۱۲۳) [4]. وكثير من أرقام المجموعتين الأخيرتين متطابق في الشكل، كالرقم ١ والرقم ۱، لكنهما حرفان مختلفان عند الحاسوب، فلا يجد البحث عن أحدهما الآخر. وحّدها قبل الفرز أو البحث أو الجمع.
  • التواريخ: احفظ التاريخ كما هو مكتوب، مع تقويمه (هجري أو ميلادي)، ومقابله الميلادي. وسجّل أي نسخة من التقويم الهجري يستخدمها برنامج التحويل؛ فالبرامج تقدّم أكثر من نسخة، منها أم القرى ونسخ حسابية [9]، وفي اختبار لهذا المقال أعطت نسختان منها تاريخين هجريين مختلفين في 387 يومًا من 731 يومًا في 2024 و2025، فجرّب التحويل على تواريخ تعرفها. وحين تتطلب اللائحة التنفيذية لنظام التعاملات الإلكترونية، الصادرة عن هيئة الحكومة الرقمية، تحديد التاريخ، فهي تشترط التقويم الميلادي على الأقل، مع إضافة الهجري إذا تطلبه نص نظامي [10، المادة 5/1]، وهي قاعدة معقولة لبياناتك أيضًا.
  • المبالغ: إذا ذُكر المبلغ بالأرقام وبالحروف، فاستخرج الاثنين وقارن بينهما.
  • الحروف: حوّل النص إلى الحروف العربية القياسية بدل أشكال العرض [3]، واحتفظ بالتشكيل إن وُجد، لكن اضبط البحث ليتجاهله.
  • الجداول: عُدّ الصفوف، وأعد جمع البنود، وقارن النتيجة بالمجموع المطبوع.

ويصلح الجدول نفسه لفريق مالية في دبي أو لندن تصله سندات تسليم بالعربية: يستخرج منها رقم أمر الشراء، والكميات، والتاريخ، ووجود الختم. ولمعرفة هل تكفيك أداة جاهزة أم تحتاج إلى نظام يُبنى لك، راجع برنامج جاهز أم برمجة نظام لشركتك؟

الخطوة 4: مراجعة بشرية للأسماء والأرقام والتواريخ والمبالغ

إذا كانت الحقول بيانات شخصية، فنظام حماية البيانات الشخصية صريح في ذلك: «لا يجوز لجهة التحكم أن تعالج البيانات الشخصية دون اتخاذ خطوات كافية للتحقق من دقتها واكتمالها وحداثتها وارتباطها بالغرض الذي جُمعت من أجله» [8، المادة 14]. وجهة التحكم هي المنشأة التي تقرر لماذا تُعالَج البيانات وكيف.

رسم كرتوني: في أرشيف سجلات، موظف سعودي مسنّ يرفع ورقة صفراء قديمة، وخيط سماوي يربط سطرًا فيها بجهاز O-bot اللوحي.
صورة توضيحية: التحقق من الدقة يعني مطابقة كل حقل مستخرج بالسطر نفسه في صفحة مصدره.
  • اعرض كل حقل بجانب الجزء المقابل له من صورة المستند.
  • حقول «دائمًا» تُراجَع في كل مستند، وحقول «عيّنة» في نسبة ثابتة تحددها مسبقًا.
  • استخدم درجة الثقة التي تعطيها الأداة لكل حقل لترتيب قائمة المراجعة، لا لتخطيها.
  • الحقول التي يترتب عليها دفع مبلغ أو موعد نهائي يعيد موظف ثانٍ فحص عيّنة منها، كما تشترط قواعد NARA أن يتولى التحقق فريق مستقل [7].
  • سجّل كل تصحيح بنوعه: رقم خاطئ، أو خلط بين نوعي الأرقام، أو تاريخ أو تقويم خاطئ، أو خطأ في نقاط اسم، أو كلمة قسّمها التطويل، أو صف جدول مُزاح، أو حقل مفقود أو في غير موضعه (كقراءة الرقم الضريبي على أنه رقم السجل التجاري)، أو نص معكوس.

وهذه التصحيحات تغذي سجل الاختبار أدناه، وتبيّن ما يحتاج إلى إصلاح: المسح، أم جدول الحقول، أم الأداة. أما الأختام والتواقيع فيراجعها موظف، لا الأداة.

الخطوة 5: احتفظ بالأصل بجانب البيانات المستخرجة

يجب أن تقود كل قيمة مستخرجة إلى الصفحة التي جاءت منها، ليتحقق منها أي أحد.

بطاقة: احتفظ بالأصل واربط كل قيمة مستخرجة بصفحتها؛ افرز، وامسح بدقة 300 نقطة في البوصة فأكثر، واستخرج، ثم يراجعها موظف.
ملخص: الخطوة 5 تختم سير العمل، فيجب أن تقود كل قيمة مستخرجة إلى الصفحة التي جاءت منها.
  • اربط كل سجل مستخرج بملفه ورقم صفحته.
  • احفظ الملف الممسوح دون تعديل، وسجّل عند استلامه بصمته الرقمية (قيمة التجزئة، hash)، وهي قيمة تتغير إذا تغيّر أي جزء منه.
  • حدّد صلاحيات الاطلاع بحسب الدور، واحتفظ بسجل لكل اطلاع وتعديل، وخذ نسخًا احتياطية دورية.

أما ملف PDF الممسوح ضوئيًا القابل للبحث (صورة المسح وتحتها طبقة نص غير مرئية) فيحفظ الأصل ويتيح البحث، لكنه لا يغني عن الحقول المراجَعة، لأن طبقة النص فيه ناتج OCR بأخطائه.

ماذا تشترط الأنظمة السعودية لحفظ السجلات الإلكترونية

هذا المقال معلومات عامة وليس استشارة قانونية. راجع التزامات منشأتك وفق النص الحالي للنظام ولائحته التنفيذية، وإن كنت تعمل خارج المملكة فراجع أنظمة بلدك.

  • المادة 6 من نظام التعاملات الإلكترونية: إذا اشترط أي نظام حفظ وثيقة، تحقق ذلك بحفظها في سجل إلكتروني يبقى بالشكل الذي أنشئ أو أرسل أو تسلم به أو بشكل يثبت تطابق محتواه معه، ومتاحًا للرجوع إليه، ومعه ما يحدد منشئه والمرسل إليه وتاريخ الإرسال والتسلم ووقتهما [11].
  • المادة 8: يعد السجل الإلكتروني أصلًا بذاته عندما تُستخدم وسائل وشروط فنية تؤكد سلامة معلوماته من الوقت الذي أنشئ فيه بشكله النهائي، وتسمح بعرض المعلومات المطلوبة متى طُلبت [11].
  • اللائحة التنفيذية: تُحفظ السجلات «بطبيعتها، وبكامل بياناتها الأصلية»، وفق قواعد موثقة، مع حفظ احتياطي دوري، وصلاحيات اطلاع بحسب حاجة العمل، وتسجيل كل اطلاع أو تغيير [10، المواد 2 و5 و6].

حدود هذه القواعد: كُتبت لسجلات التعاملات الإلكترونية. أما إن كانت النسخة الممسوحة تغني عن أصل ورقي يُلزمك نظامٌ بحفظه، فهذا سؤال لمحاميك؛ ولا تُتلِف الأصول اعتمادًا على OCR. وخارج المملكة اسأل: هل النسخة مطابقة للأصل، ويمكن الرجوع إليها، ويُعرف مصدرها؟

صور الهويات وأين تذهب بياناتك

تُلزم المادة 31 من اللائحة التنفيذية لنظام حماية البيانات الشخصية جهةَ التحكم بالامتناع عن تصوير الوثائق الرسمية التي تحدد هوية صاحبها، الصادرة من الجهات العامة، أو نسخها، إلا بطلب من جهة عامة مختصة أو تنفيذًا لأحكام نظام، وبحمايتها وإتلافها فور انتهاء الغرض منها ما لم يوجد متطلب نظامي للاحتفاظ بها [12] (وانظر المادة 28 من النظام [8]). فلا تمسح الهوية الوطنية أو هوية مقيم (الإقامة) «احتياطًا»، وسجّل الرقم الذي تحتاجه فقط من الأصل المعروض عليك، إن احتجته.

ورفع المستندات إلى مواقع التحويل المجانية أو أدوات الذكاء الاصطناعي العامة يرسلها إلى خوادم جهة أخرى، ربما خارج المملكة. فإن كانت فيها بيانات شخصية، فتنطبق شروط النقل في المادة 29 من نظام حماية البيانات الشخصية، ومنها «أن يقتصر النقل أو الإفصاح على الحد الأدنى من البيانات الشخصية الذي تدعو الحاجة إليه» [8].

وتنص مبادئ سدايا للذكاء الاصطناعي التوليدي على أن تطبّق الجهات سياسات تمنع المستخدمين من إدخال معلومات مصنفة في أدوات خارجية [13، البند 5.4]، فاكتب لموظفيك قائمة بما لا يُدخَل في هذه الأدوات أبدًا.

ابدأ بنوع واحد من المستندات وقِس نسبة الأخطاء

ابدأ بنوع المستندات الذي يأخذ النصيب الأكبر من وقت فريقك، وتحقّق من صلاحيته عبر اختبار الأسئلة الأربعة. واجمع نحو 50 مستندًا حقيقيًا متفاوت الجودة (تقدير عملي، لا رقم إحصائي)، وقرّر نسب الخطأ التي تقبلها قبل أن ترى النتائج.

احتفظ بسجل اختبار، صف لكل مستند:

المستندجودة المسح (جيدة / متوسطة / ضعيفة)الحقول المراجَعةالحقول الخاطئةأنواع الأخطاءدقائق الاستخراج والمراجعة
1

ثم احسب أربعة أرقام:

  • نسبة أخطاء الحقول = الحقول الخاطئة ÷ الحقول المراجَعة. مثال حسابي فقط، لا نتيجة معتادة: 6 أخطاء في 400 حقل = 1.5%.
  • النسبة نفسها للمسوح الضعيفة وحدها: إن كانت أعلى بكثير، فأصلح الخطوة 2 قبل تغيير الأداة.
  • أخطاء فاتت المراجعة، من إعادة فحص موظف ثانٍ لعيّنة من حقول «دائمًا»: يجب أن تكون صفرًا قبل أن تعتمد على الناتج.
  • الدقائق الموفَّرة شهريًا = (دقائق المستند يدويًا − دقائقه مع الاستخراج والمراجعة) × عدد المستندات في الشهر. قِس وقت 10 مستندات في كل طريقة، وخذ الوسيط (القيمة التي في المنتصف).

وإذا تركزت الأخطاء في نوع واحد، كالتواريخ، فأصلح قاعدته قبل تغيير الأداة. وإن كانت الدقائق الموفَّرة قليلة، فأبقِ المهمة يدوية.

خطوتك التالية

هذا الأسبوع، طبّق هذا الاختبار على نوع واحد من المستندات: جدول حقول من 8 إلى 10 حقول، و50 مستندًا حقيقيًا ممسوحًا وفق قائمة الخطوة 2. بهذه الأرقام تعرف ما يستطيعه OCR عربي على مستنداتك أنت. وإن أردت من يساعدك في ذلك، فهذه طريقة عمل O AI (أو إيه آي)، شركة ذكاء اصطناعي وبرمجيات سعودية:

ابدأ بمهمة واحدة بطيئة ومتكررة: المستندات، أو الرد على العملاء، أو التقارير، أو بيانات موزعة بين أنظمة. تدرس O AI هذه المهمة، وتقيّم جدوى الذكاء الاصطناعي فيها، ثم تدمجه في أنظمتك القائمة أو تبني نظامًا جديدًا. والاستشارة الأولى والعرض دون أي التزام.

أخبرنا بنوع المستندات الذي يستهلك معظم وقت فريقك، واحجز استشارة مجانية لنقيّم معك جدوى استخراج بياناته بالذكاء الاصطناعي. ونردّ عليك خلال يوم عمل واحد.

الأسئلة الشائعة

هل يمكن تحويل PDF عربي إلى وورد بدون أخطاء؟

لا يمكن ضمان ذلك إذا كان الملف ممسوحًا ضوئيًا. قلّصت نماذج الذكاء الاصطناعي الأحدث أخطاء الحروف كثيرًا، لكن أفضل نموذج في اختبار KITAB-Bench المنشور عام 2025 لم يحقق إلا نحو 65% في تحويل ملفات PDF عربية صعبة كاملة، بدرجة تجمع دقة النص ودقة الجداول. فإن كان الملف رقميًا بطبقة نص سليمة، فاستخرج النص مباشرة. وإن كان ممسوحًا، فاحرص على جودة المسح، واستخرج الحقول، وراجع الأسماء والأرقام والتواريخ.

هل يمكن تحويل PDF عربي ممسوح إلى Excel؟

نعم، وهو في الجداول أنسب من وورد غالبًا، لأن كل قيمة تقع في خلية مستقلة تراجعها وتجمعها. لكن راجع الجداول أكثر من النص العادي؛ فتحويل ملفات PDF كاملة بجداولها كان نقطة ضعف حتى لأفضل نموذج في اختبار KITAB-Bench عام 2025. استخرج الأعمدة التي تحتاجها فقط، ووحّد الأرقام في نوع واحد ليتمكن الجدول من فرزها وجمعها، وأعد جمع كل عمود وقارنه بالمجموع المطبوع. وإن كان الجدول صادرًا من نظام أو بنك، فاطلب ملف Excel أو CSV منه مباشرة.

هل يمكن ترجمة PDF عربي ممسوح ضوئيًا إلى الإنجليزية؟

نعم، لكن راجع النص العربي أولًا. فالترجمة تعمل على النص الذي أخرجه OCR، فينتقل الرقم أو التاريخ أو الاسم الخاطئ كما هو إلى النص الإنجليزي، حيث لن يكتشفه قارئ لا يعرف العربية. طبّق الخطوات من 2 إلى 4 قبل الترجمة، واحتفظ بالأسماء بالعربية بجانب كتابتها اللاتينية، وطابق المبالغ والتواريخ مع الصورة. وفي العقود وكل ما ستعتمد عليه، اجعل مترجمًا مؤهلًا يراجع النتيجة.

لماذا تظهر الحروف العربية متقطعة أو معكوسة عند النسخ من ملف PDF؟

لأحد سببين غالبًا: أن طبقة النص في الملف تخزّن الحروف بأشكال العرض، وهو ما لا يوصي به معيار يونيكود، أو بترتيب العرض بدل ترتيب القراءة؛ أو أن الأداة التي تنسخ بها أو تستخرج النص تعيد ترتيب الحروف من اليمين إلى اليسار خطأً، ففي اختبار لهذا المقال قلبت أداة استخراج مفتوحة المصدر كل لام وألف في ملف سعودي رسمي قرأته أداة أخرى سليمًا. جرّب أداة أخرى أولًا، فإن بقي الخلل فحوّل النص إلى الحروف القياسية أو شغّل OCR على صورة الصفحة، ثم طابق الأرقام مع الصورة.

ما أفضل برنامج OCR عربي؟

الأفضل هو ما يعطي أقل الأخطاء على مستنداتك أنت. فقد وجد اختبار KITAB-Bench (2025) أنه لا يوجد نموذج يتقدم في كل صعوبات العربية (الخطوط، والتشكيل، والتطويل، والنص المائل)، ويقرّ الباحثون بأنه لا يغطي السجلات الحكومية والمالية الممسوحة. ضيّق القائمة حسب النوع أولًا: برنامج OCR يعمل على أجهزتك يُبقي الملفات لديك؛ وخدمة سحابية لمعالجة المستندات بعقد مع شركتك قد تضيف استخراج الحقول ومؤشرات الثقة، فاسأل أين تُعالَج الملفات وتُحفظ، وإلى متى، وهل تُستخدم لتدريب النماذج؛ ومواقع التحويل المجانية لا تصلح إلا لصفحات ليس فيها شيء شخصي أو سري. ثم جرّب الأدوات التي تفاضل بينها على 50 مستندًا من ملفاتك نفسها، وقارن نسبة أخطاء الحقول والدقائق لكل مستند.

هل من الآمن رفع المستندات إلى مواقع OCR مجانية؟

لا، إذا كانت فيها بيانات شخصية أو سرية. فالملف يذهب إلى خوادم جهة أخرى، وربما خارج المملكة، وهنا تنطبق شروط النقل في المادة 29 من نظام حماية البيانات الشخصية، ومنها ألا يُنقل إلا الحد الأدنى من البيانات. وتنص مبادئ سدايا للذكاء الاصطناعي التوليدي على أن تطبّق الجهات سياسات تمنع إدخال المعلومات المصنفة في أدوات خارجية. واستخدم أداة بعقد مع شركتك تحدد أين تُعالَج الملفات وهل تُحفظ، أو أداة تعمل على أجهزتك. أما الوثائق الرسمية التي تحدد الهوية، فالأصل ألا تصوّرها أو تنسخها إلا بطلب جهة عامة مختصة أو تنفيذًا لنظام (المادة 31 من اللائحة التنفيذية للنظام).

هل يستطيع الذكاء الاصطناعي قراءة الخط العربي المكتوب باليد؟

جزئيًا، والنتيجة تتوقف على الخط وجودة الصورة؛ فخط اليد يختلف من كاتب إلى آخر، وكثيرًا ما تُحذف فيه الحركات. ويشمل اختبار KITAB-Bench نصوصًا مكتوبة باليد، لكن الفيصل هو التجربة على عيّنة من مستنداتك. واعتبر ناتج الخط اليدوي اقتراحًا وراجع كل حقل فيه، وللأعداد القليلة قد يكون الإدخال اليدوي أسرع.

هل يمكن التخلص من الأصل الورقي بعد مسحه ضوئيًا؟

لا تفعل ذلك اعتمادًا على OCR. يضع نظام التعاملات الإلكترونية السعودي شروطًا ليُعد السجل الإلكتروني محفوظًا وأصلًا بذاته (المادتان 6 و8)، ويستثني تعاملات بعينها من أحكامه (المادة 3). اسأل محاميك عن الأصول التي يلزمك حفظها، وإن كنت تعمل خارج المملكة فراجع أنظمة بلدك.

كيف أُعدّ هذا المقال: أُعدّ من المصادر المذكورة أدناه، واطُّلع عليها في 29 سبتمبر 2026، ومن اختبارات لاستخراج النص وتحويل التواريخ أُجريت لهذا المقال. صيغت المسودة بمساعدة الذكاء الاصطناعي، ثم طوبقت مع المصادر. الصور توضيحية مولّدة بالذكاء الاصطناعي.

المصادر

  1. Advancements and Challenges in Arabic Optical Character Recognition: A Comprehensive Survey، Kasem وMahmoud وKang (ديسمبر 2023، بالإنجليزية) (يفتح في نافذة جديدة)أرشيف arXiv (نسخة أولية) · arxiv.org
  2. KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding، Findings of ACL 2025 (بالإنجليزية) (يفتح في نافذة جديدة)رابطة اللغويات الحاسوبية (ACL Anthology) · aclanthology.org
  3. FAQ: Ligatures, Digraphs and Presentation Forms (بالإنجليزية) (يفتح في نافذة جديدة)اتحاد يونيكود (Unicode Consortium) · unicode.org
  4. FAQ: Arabic Script (بالإنجليزية) (يفتح في نافذة جديدة)اتحاد يونيكود (Unicode Consortium) · unicode.org
  5. الدليل الإرشادي التفصيلي للفوترة الإلكترونية (النسخة الثانية، مايو 2023) (يفتح في نافذة جديدة)هيئة الزكاة والضريبة والجمارك · zatca.gov.sa
  6. Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR، Hennara وآخرون (سبتمبر 2025، بالإنجليزية) (يفتح في نافذة جديدة)أرشيف arXiv (نسخة أولية) · arxiv.org
  7. 36 CFR Part 1236, Subpart E: Digitizing Permanent Federal Records (بالإنجليزية) (يفتح في نافذة جديدة)الإدارة الوطنية للأرشيف والسجلات في الولايات المتحدة (NARA) · ecfr.gov
  8. نظام حماية البيانات الشخصية (النص الرسمي شاملًا التعديلات الصادرة بالمرسوم الملكي م/148) (يفتح في نافذة جديدة)هيئة الخبراء بمجلس الوزراء · laws.boe.gov.sa
  9. BCP 47 calendar identifiers (calendar.xml) (بالإنجليزية) (يفتح في نافذة جديدة)مشروع Unicode CLDR · github.com
  10. اللائحة التنفيذية لنظام التعاملات الإلكترونية (الإصدار 1.1، 2024) (يفتح في نافذة جديدة)هيئة الحكومة الرقمية · dga.gov.sa
  11. نظام التعاملات الإلكترونية (المرسوم الملكي م/18 بتاريخ 8/3/1428هـ) (يفتح في نافذة جديدة)هيئة الخبراء بمجلس الوزراء · laws.boe.gov.sa
  12. اللائحة التنفيذية لنظام حماية البيانات الشخصية (يفتح في نافذة جديدة)الهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا) · sdaia.gov.sa
  13. مبادئ الذكاء الاصطناعي التوليدي للعموم (مايو 2025) (يفتح في نافذة جديدة)الهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا) · sdaia.gov.sa

عن الكاتب

عبدالله الشلويAbdullah Alshalawi

المؤسس والرئيس التنفيذي

أنا عبدالله الشلوي، مؤسس O AI (أو إيه آي) ورئيسها التنفيذي. أسّست الشركة في الخبر في مارس 2026 لأساعد المنشآت في المملكة على الاستفادة من الذكاء الاصطناعي بطريقة عملية: إدخاله في العمل الذي تؤديه فرقها اليوم، وبناء برمجيات مخصّصة على مقاس طريقة عملها، وأتمتة المهام المتكررة التي تُبطئها.

وأقود كذلك «رُشد»، منصتنا لإدارة مكاتب المحاماة، المتاحة على الويب وiPhone وAndroid، والتي تجمع القضايا والعملاء والجلسات والفوترة في مكان واحد، مع صياغة المستندات بمساعدة الذكاء الاصطناعي بالعربية والإنجليزية.

وفي هذه المدونة أكتب أدلة عملية لأصحاب الأعمال ومكاتب المحاماة في المملكة: أين يفيد الذكاء الاصطناعي وأين يتوقف، وما الذي يحدد تكلفة البرمجيات المخصّصة، وكيف تبدأ بمهمة واحدة وتقيس نتيجتها قبل أن تنفق أكثر.

مقالات أخرى بقلم عبدالله الشلوي