OCR عربي: لماذا يصعب تحويل PDF إلى وورد بدون أخطاء، وكيف تلتقط الأخطاء قبل أن تصل إلى أنظمتك
لماذا يتعثر OCR عربي في الأرقام والتواريخ والجداول، وكيف تقرأ نسب الدقة التي تعلنها الأدوات، وسير عمل من خمس خطوات مع جدول تقيس به نسبة الأخطاء على مستنداتك.

أبرز النقاط
- لا توجد أداة OCR تضمن نصًا عربيًا بلا أخطاء: الأخطاء تتركز في الأرقام والتواريخ والأسماء والجداول والكلمات الممدودة، فأبقِ مراجعة الموظف.
- في اختبار KITAB-Bench (2025) سجّلت نماذج الذكاء الاصطناعي أخطاء حروف أقل من أدوات OCR التقليدية، لكن أفضلها لم يحقق إلا نحو 65% في تحويل ملفات PDF صعبة كاملة بجداولها.
- افرز أولًا: النص الرقمي السليم وملف XML للفاتورة الإلكترونية وتصدير الأنظمة أدق من المسح، وإن تكسّرت العربية عند النسخ فجرّب أداة استخراج أخرى قبل OCR.
- امسح بدقة 300 نقطة في البوصة على الأقل، بصفحات مستقيمة وبالألوان أو الرمادي، واستخرج حقولًا لها قواعد صيغة ومطابقة، وقِس نسبة الأخطاء على 50 مستندًا حقيقيًا.
- احفظ الملف الممسوح دون تعديل ومربوطًا بكل سجل، ولا تصوّر الوثائق الرسمية للهوية أو تنسخها إلا بطلب جهة مختصة أو تنفيذًا لنظام (المادة 31 من اللائحة التنفيذية لنظام حماية البيانات الشخصية).
في هذه الصفحة
- لماذا يصعب التعرّف الضوئي على الحروف العربية؟
- ماذا وجد اختبار أكاديمي لأدوات OCR عربي عام 2025؟
- الخطوة 1: هل يحتاج المستند إلى OCR أصلًا؟ افرز قبل المسح
- الخطوة 2: حسّن جودة المسح قبل أن تلوم البرنامج
- الخطوة 3: استخراج النصوص من PDF إلى حقول، لا إلى ملف وورد فقط
- الخطوة 4: مراجعة بشرية للأسماء والأرقام والتواريخ والمبالغ
- الخطوة 5: احتفظ بالأصل بجانب البيانات المستخرجة
- ابدأ بنوع واحد من المستندات وقِس نسبة الأخطاء
- خطوتك التالية
صارت أدوات التعرّف الضوئي على الحروف (OCR) تقرأ العربية بما يكفي لتوفّر عليك كثيرًا من إعادة إدخال النص يدويًا في ملفات PDF الممسوحة ضوئيًا، لكن نتيجتها لا تُعتمد دون مراجعة، ولا توجد أداة تضمن تحويل PDF إلى وورد بدون أخطاء.
وحين تستخدم أداة OCR عربي، تتركز الأخطاء غالبًا في الأرقام والتواريخ والأسماء والجداول والكلمات الممدودة، حيث يكلّفك الخطأ مالًا. والحل سير عمل من خمس خطوات: تفرز المستندات، وتحسّن المسح، وتستخرج الحقول، ويراجعها موظف، ويبقى الأصل بجانبها.
ويصلح سير العمل هذا في الرياض ودبي كما في مكتب بلندن تصله مستندات عربية.
لماذا يصعب التعرّف الضوئي على الحروف العربية؟
كيف تُربك طبيعة الخط العربي أدوات OCR
الحروف العربية متصلة، ويتغير شكل الحرف بحسب موضعه في الكلمة، وكثيرًا ما تُحذف الحركات في الكتابة اليومية، فيصعب على الأداة استعادة النص كما هو [1]. والنص يسير من اليمين إلى اليسار [2]، بينما تُكتب الأرقام والرموز اللاتينية في السطر نفسه من اليسار إلى اليمين. والنقاط وحدها تفرّق بين ب وت وث، فنقطة باهتة قد تبدّل الحرف.
ويضيف الباحثون في اختبار KITAB-Bench المعياري (Benchmark) أربعة مواضع تتعثر فيها الأدوات: الخطوط المعقدة، وقراءة الأرقام، وتطويل الكلمات (مدّ الحرف بالكشيدة لضبط طول السطر، كما في «جـــميل»)، والتعرّف على بنية الجداول [2].
حل مشكلة الحروف العربية المتقطعة أو المعكوسة في PDF: ثلاثة أسباب محتملة
حين يُفسد تحويل PDF إلى وورد النص العربي، فالسبب غالبًا واحد من ثلاثة:
- ملف PDF ممسوح ضوئيًا: صورة للصفحة، لا يُنسخ منها شيء حتى يقرأها OCR.
- ملف PDF رقمي بطبقة نص غير سليمة: تُخزَّن فيه العربية بأشكال العرض (شكل الحرف على الشاشة) أو بترتيب العرض بدل الحروف القياسية بترتيب القراءة، فيبدو النص سليمًا ثم يتكسّر عند النسخ أو البحث.
- أداة استخراج تخطئ: طبقة النص سليمة، لكن الأداة تعيد ترتيب الحروف خطأً.
ويوضح اتحاد يونيكود (Unicode Consortium)، واضع معيار ترميز الحروف في الحواسيب، أن أشكال العرض العربية مرمَّزة للتوافق فقط، ولا يُنصح باستخدامها لأنها لا تضمن سلامة البيانات وقابليتها للتبادل بين الأنظمة [3، 4].
مثال من ملف رسمي: في اختبار لهذا المقال في 29 سبتمبر 2026، استُخرج نص «الدليل الإرشادي التفصيلي للفوترة الإلكترونية» الصادر عن هيئة الزكاة والضريبة والجمارك (ZATCA) بثلاث أدوات شائعة مفتوحة المصدر [5]. قلبت الأولى ترتيب اللام والألف في كل موضع: خرجت «خلال» بهذا الشكل «خالل» في مواضعها الـ36 كلها، ولم تسلم «لا» المنفردة في أي موضع، فخرجت جملة الدليل المقتبسة في الخطوة 1 «ولا تعتبر الفاتورة الورقية…» هكذا: «وال تعتبر الفاتورة الورقية…»، وضاع النفي.
أما الأداة الثانية فقرأت الملف نفسه سليمًا، وقلبت الثالثة أسطرًا كاملة، مع أن الملف يظهر سليمًا على الشاشة. اختبار سريع: ابحث في النص المستخرج عن «لا»؛ فإن غابت وهي بهذا الشيوع، فجرّب أداة أخرى قبل أن تحكم على الملف أو تلجأ إلى OCR.
| ما تراه | السبب المرجّح | أول ما تفعله |
|---|---|---|
| حروف متقطعة أو رموز غريبة عند اللصق | طبقة النص تخزّن أشكال العرض | حوّل النص إلى الحروف القياسية، أو شغّل OCR على صورة الصفحة |
| كلمات أو أزواج حروف معكوسة، مثل «خالل» | خطأ في أداة الاستخراج، أو نص مخزّن بترتيب العرض | جرّب أداة استخراج أخرى، ثم شغّل OCR على صورة الصفحة |
| أرقام في غير موضعها داخل الجملة | اختلاط اتجاهي الكتابة | طابِق الأرقام مع صورة الصفحة دائمًا |
| أعمدة جدول مُزاحة أو مدموجة | خطأ في قراءة تخطيط الصفحة | استخرج الحقول، وأعد جمع الصفوف وقارنها بالمجموع المطبوع (الخطوة 3) |
ماذا وجد اختبار أكاديمي لأدوات OCR عربي عام 2025؟
بنى اختبار KITAB-Bench باحثون من جامعة محمد بن زايد للذكاء الاصطناعي في أبوظبي وجهات شريكة، ونُشر ضمن أبحاث Findings of ACL 2025 المحكّمة، المصاحبة لمؤتمر رابطة اللغويات الحاسوبية. ويضم 8,809 عيّنات في 9 مجالات، منها الخط اليدوي والجداول والرسوم البيانية [2].
واختبر النماذج المتاحة في مطلع 2025، ثم وجدت ورقة لاحقة أخطاءً في النص المرجعي لاختبار ملفات PDF فيه [6]، فخذ نتائجه التالية مؤشرًا لا حكمًا نهائيًا.
نماذج الذكاء الاصطناعي الأحدث مقابل أدوات التعرّف التقليدية
تفوقت نماذج الرؤية واللغة، وهي نماذج ذكاء اصطناعي تقرأ صورة الصفحة وتفهم لغتها معًا، على أدوات OCR التقليدية بفارق متوسطه 60% في معدل الخطأ في الحروف (CER)، أي نسبة الحروف الخاطئة أو الناقصة أو الزائدة [2]. فالرقم يصف فرقًا في الخطأ، ولا يعني دقة بنسبة 60%. ولم يتصدر نموذج واحد في كل صعوبات العربية من خطوط وتشكيل وتطويل ونص مائل [2].
أين تعثّر أفضل نموذج في الاختبار
خصّ الباحثون بالذكر تحويل ملف PDF كامل إلى نص منسّق يحفظ الجداول، ولم يحقق فيه أفضل نموذج إلا نحو 65% [2]. وهذه النسبة لا تعني أن 65% من الكلمات صحيحة؛ إنها درجة مركّبة تجمع دقة النص ودقة بنية الجداول، وقيست على 33 ملفًا اختيرت عمدًا لصعوبتها، فيها جداول ملونة، وخلايا مدموجة، وعلامات مائية، وملاحظات بخط اليد.
ولهذا تقوم الخطوة 3 على استخراج حقول محددة. ولأن النماذج الحديثة أظهرت ضعفًا مع النص المائل [2]، تشدد الخطوة 2 على استقامة الصفحات عند المسح.
ما لم يشمله الاختبار: مستنداتك أنت
يقرّ الباحثون بأن الاختبار لا يغطي المستندات المؤسسية الممسوحة، كالسجلات التاريخية والحكومية والمالية، وبأن النماذج كثيرًا ما تعجز عن التعميم بين المجالات وتخطيطات الصفحات [2]. والفواتير والخطابات الحكومية هي تحديدًا هذا النوع من المستندات، والعقود قريبة منها. وكذلك أي خدمة لاستخراج النصوص من الصور بالذكاء الاصطناعي: نجاحها في صفحة نظيفة لا يضمن نجاحها في خطاب عليه ختم وتوقيع. فجرّب على ملفاتك أنت.
ستجد مواقع تعد بتحويل دقيق بنسبة 100%، وأخرى تعلن دقة 95% أو 99%. فاسأل قبل أن تصدّق أي نسبة:
| السؤال | لماذا يهم |
|---|---|
| 1. دقة ماذا: الحروف، أم الكلمات، أم الحقول، أم المستند كاملًا؟ | 99% في الحروف تعني نحو 20 خطأً في صفحة من 2,000 حرف، قد يكون أحدها في رقم هوية أو مبلغ |
| 2. على أي مستندات: نص رقمي، أم مسح ضوئي، أم صور بالجوال، أم خط يد؟ | نتيجة الصفحة النظيفة لا تنتقل إلى صورة جوال مائلة |
| 3. مستندات مَن: عيّنة المورّد أم مستنداتك؟ | الباحثون أنفسهم ينبّهون إلى ضعف التعميم [2] |
| 4. هل تشمل الأرقام والتواريخ والجداول؟ | فيها تقع الأخطاء التي تكلّفك مالًا أو تُفوّت عليك موعدًا |
| 5. ماذا يحدث للنتائج منخفضة الثقة: تُحال إلى موظف، أم تمر كما هي؟ | الخطأ الذي لا يُنبَّه إليه أحد يصل إلى أنظمتك |
ولبقية أسئلة اختيار المورد، راجع 10 أسئلة قبل أن توقّع مع شركة برمجة.
الخطوة 1: هل يحتاج المستند إلى OCR أصلًا؟ افرز قبل المسح
بعض المستندات لا تحتاج إلى OCR أصلًا، فقبل أن تمسح شيئًا، صنّفها:
| المستند الذي لديك | الطريق الأنسب | السبب |
|---|---|---|
| ملف PDF رقمي يُنسخ نصه العربي سليمًا | استخرج النص مباشرة، ثم وحّد صيغته | لن يضيف OCR هنا إلا أخطاء |
| ملف PDF رقمي تتكسر عربيته عند النسخ | جرّب أداة استخراج أخرى، ثم شغّل OCR على صورة الصفحة | الخلل في طبقة النص أو في أداة الاستخراج |
| فاتورة ضريبية (بين منشأتين) من مورد سعودي مشمول بالمرحلة الثانية | اطلب ملف XML، أو ملف PDF/A-3 المضمَّن فيه XML | تشترط الهيئة هاتين الصيغتين لمشاركتها مع المشتري [5] |
| تقارير الأنظمة والبنوك والبوابات الإلكترونية | اطلب ملف CSV أو Excel | أدق من قراءة نسخة مطبوعة |
| مستندات مطبوعة ممسوحة أو مصوّرة | الخطوات من 2 إلى 5 | هذا ما صُمم له OCR |
| خط اليد أو الملفات القديمة التالفة | اعتبر الناتج اقتراحًا، وراجع كل حقل | للأعداد القليلة قد يكون الإدخال اليدوي أسرع |
والمرحلة الثانية (الربط والتكامل) هي التي تُربط فيها أنظمة فوترة المنشآت بمنصة «فاتورة» التابعة للهيئة [5]. وينص الدليل على أنه «لا تعتبر الفاتورة الورقية التي حولت إلى صيغة إلكترونية من خلال النسخ أو المسح الضوئي أو أي طريقة أخرى بمثابة فاتورة إلكترونية مطابقة» [5]، فاطلب البيانات المنظمة من المورد.
ولا يناسب OCR كذلك المستندات النادرة التي تُقرأ مرة واحدة؛ فقراءة موظف لها أقل تكلفة من إعداد الاستخراج.
الخطوة 2: حسّن جودة المسح قبل أن تلوم البرنامج
جودة المسح هي الجزء الذي تتحكم فيه. وتستعين القائمة التالية بقواعد الإدارة الوطنية للأرشيف والسجلات في الولايات المتحدة (NARA) لرقمنة السجلات الورقية الفيدرالية الدائمة، مرجعًا للمقارنة لا متطلبًا سعوديًا [7].

- 300 نقطة في البوصة (dpi) على الأقل بمقاس المستند الأصلي، وهو الحد الأدنى في تلك القواعد [7].
- بالألوان أو بتدرجات الرمادي، كما تنص تلك القواعد للسجلات الورقية الحديثة [7]؛ فالأبيض والأسود الصافي قد يُسقط الأختام الباهتة والتواقيع، بل ونقاط الحروف نفسها.
- صفحات مستقيمة، مقصوصة الحواف الداكنة: فالنص المائل نقطة ضعف لدى النماذج الحديثة [2].
- ملف واحد لكل مستند، بكل صفحاته مرتبة.
- صور الجوال: مستند مسطّح، وإضاءة متجانسة بلا ظل، وصفحة كاملة دون أن تظهر الأصابع. والصورة الضبابية تُعاد ولا تُصلَح.
- الأصل لا نسخة النسخة: امسح أوضح نسخة لديك، فكل نسخة عن نسخة تطمس النقاط أكثر.
- افحص الناتج مع الإعدادات: افتح خمسة ملفات كل أسبوع بتكبير 100%.
الخطوة 3: استخراج النصوص من PDF إلى حقول، لا إلى ملف وورد فقط
ملف وورد يعطيك نصًا عليك أن تقرأه من جديد، أما الحقول فبيانات تراجعها وتبحث فيها وتجمعها وتُدخلها في أنظمتك.
واستخرج الحقول التي تحتاج إليها فقط، ولا تأخذ من البيانات الشخصية إلا ما يخدم الغرض. فنظام حماية البيانات الشخصية السعودي، الذي تشرف على تطبيقه الهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا)، يوجب أن يكون محتوى البيانات الشخصية «مقصوراً على الحد الأدنى اللازم لتحقيق الغرض من جمعها» [8، المادة 11، الفقرة 3].
وهذا جدول حقول لمثال افتراضي (عقد إيجار ممسوح ضوئيًا)، انسخه وعدّله:
| الحقل | مكانه في المستند | قاعدة الصيغة | يُطابَق مع | المراجعة |
|---|---|---|---|---|
| اسم المستأجر | بيانات الأطراف | بالعربية كما كُتب، دون تحويل آلي إلى حروف لاتينية | قائمة المستأجرين | دائمًا |
| رقم الهوية أو السجل التجاري | بيانات الأطراف | أرقام فقط، بنوع أرقام واحد، وبالطول المعتاد | قائمة المستأجرين أو السجل التجاري | دائمًا |
| رقم الوحدة | البند الأول | كما كُتب | سجل الوحدات | عيّنة |
| الإيجار بالأرقام | بند الدفع | المبلغ بالأرقام مع رمز العملة (مثل SAR) | الإيجار بالحروف | دائمًا |
| تاريخا البداية والنهاية | بند المدة | التاريخ كما كُتب + تقويمه + مقابله الميلادي | كل منهما مع الآخر ومع مدة العقد | دائمًا |
| صفوف جدول الدفعات | جدول الدفعات | عدد الصفوف، وتاريخ ومبلغ لكل صف | المجموع المطبوع | دائمًا (المجموع) |
| البنود غير المعتادة | أي موضع | لا تُستخرج، وتُحال الصفحة إلى موظف | لا ينطبق | يقرؤها موظف |
ثم وحّد الصيغة:
- الأرقام: يميّز معيار يونيكود ثلاث مجموعات من الأرقام: الأوروبية (123)، والعربية الهندية (١٢٣) التي يسميها كثيرون «الأرقام الهندية»، والعربية الهندية الشرقية (۱۲۳) [4]. وكثير من أرقام المجموعتين الأخيرتين متطابق في الشكل، كالرقم ١ والرقم ۱، لكنهما حرفان مختلفان عند الحاسوب، فلا يجد البحث عن أحدهما الآخر. وحّدها قبل الفرز أو البحث أو الجمع.
- التواريخ: احفظ التاريخ كما هو مكتوب، مع تقويمه (هجري أو ميلادي)، ومقابله الميلادي. وسجّل أي نسخة من التقويم الهجري يستخدمها برنامج التحويل؛ فالبرامج تقدّم أكثر من نسخة، منها أم القرى ونسخ حسابية [9]، وفي اختبار لهذا المقال أعطت نسختان منها تاريخين هجريين مختلفين في 387 يومًا من 731 يومًا في 2024 و2025، فجرّب التحويل على تواريخ تعرفها. وحين تتطلب اللائحة التنفيذية لنظام التعاملات الإلكترونية، الصادرة عن هيئة الحكومة الرقمية، تحديد التاريخ، فهي تشترط التقويم الميلادي على الأقل، مع إضافة الهجري إذا تطلبه نص نظامي [10، المادة 5/1]، وهي قاعدة معقولة لبياناتك أيضًا.
- المبالغ: إذا ذُكر المبلغ بالأرقام وبالحروف، فاستخرج الاثنين وقارن بينهما.
- الحروف: حوّل النص إلى الحروف العربية القياسية بدل أشكال العرض [3]، واحتفظ بالتشكيل إن وُجد، لكن اضبط البحث ليتجاهله.
- الجداول: عُدّ الصفوف، وأعد جمع البنود، وقارن النتيجة بالمجموع المطبوع.
ويصلح الجدول نفسه لفريق مالية في دبي أو لندن تصله سندات تسليم بالعربية: يستخرج منها رقم أمر الشراء، والكميات، والتاريخ، ووجود الختم. ولمعرفة هل تكفيك أداة جاهزة أم تحتاج إلى نظام يُبنى لك، راجع برنامج جاهز أم برمجة نظام لشركتك؟
الخطوة 4: مراجعة بشرية للأسماء والأرقام والتواريخ والمبالغ
إذا كانت الحقول بيانات شخصية، فنظام حماية البيانات الشخصية صريح في ذلك: «لا يجوز لجهة التحكم أن تعالج البيانات الشخصية دون اتخاذ خطوات كافية للتحقق من دقتها واكتمالها وحداثتها وارتباطها بالغرض الذي جُمعت من أجله» [8، المادة 14]. وجهة التحكم هي المنشأة التي تقرر لماذا تُعالَج البيانات وكيف.

- اعرض كل حقل بجانب الجزء المقابل له من صورة المستند.
- حقول «دائمًا» تُراجَع في كل مستند، وحقول «عيّنة» في نسبة ثابتة تحددها مسبقًا.
- استخدم درجة الثقة التي تعطيها الأداة لكل حقل لترتيب قائمة المراجعة، لا لتخطيها.
- الحقول التي يترتب عليها دفع مبلغ أو موعد نهائي يعيد موظف ثانٍ فحص عيّنة منها، كما تشترط قواعد NARA أن يتولى التحقق فريق مستقل [7].
- سجّل كل تصحيح بنوعه: رقم خاطئ، أو خلط بين نوعي الأرقام، أو تاريخ أو تقويم خاطئ، أو خطأ في نقاط اسم، أو كلمة قسّمها التطويل، أو صف جدول مُزاح، أو حقل مفقود أو في غير موضعه (كقراءة الرقم الضريبي على أنه رقم السجل التجاري)، أو نص معكوس.
وهذه التصحيحات تغذي سجل الاختبار أدناه، وتبيّن ما يحتاج إلى إصلاح: المسح، أم جدول الحقول، أم الأداة. أما الأختام والتواقيع فيراجعها موظف، لا الأداة.
الخطوة 5: احتفظ بالأصل بجانب البيانات المستخرجة
يجب أن تقود كل قيمة مستخرجة إلى الصفحة التي جاءت منها، ليتحقق منها أي أحد.

- اربط كل سجل مستخرج بملفه ورقم صفحته.
- احفظ الملف الممسوح دون تعديل، وسجّل عند استلامه بصمته الرقمية (قيمة التجزئة، hash)، وهي قيمة تتغير إذا تغيّر أي جزء منه.
- حدّد صلاحيات الاطلاع بحسب الدور، واحتفظ بسجل لكل اطلاع وتعديل، وخذ نسخًا احتياطية دورية.
أما ملف PDF الممسوح ضوئيًا القابل للبحث (صورة المسح وتحتها طبقة نص غير مرئية) فيحفظ الأصل ويتيح البحث، لكنه لا يغني عن الحقول المراجَعة، لأن طبقة النص فيه ناتج OCR بأخطائه.
ماذا تشترط الأنظمة السعودية لحفظ السجلات الإلكترونية
هذا المقال معلومات عامة وليس استشارة قانونية. راجع التزامات منشأتك وفق النص الحالي للنظام ولائحته التنفيذية، وإن كنت تعمل خارج المملكة فراجع أنظمة بلدك.
- المادة 6 من نظام التعاملات الإلكترونية: إذا اشترط أي نظام حفظ وثيقة، تحقق ذلك بحفظها في سجل إلكتروني يبقى بالشكل الذي أنشئ أو أرسل أو تسلم به أو بشكل يثبت تطابق محتواه معه، ومتاحًا للرجوع إليه، ومعه ما يحدد منشئه والمرسل إليه وتاريخ الإرسال والتسلم ووقتهما [11].
- المادة 8: يعد السجل الإلكتروني أصلًا بذاته عندما تُستخدم وسائل وشروط فنية تؤكد سلامة معلوماته من الوقت الذي أنشئ فيه بشكله النهائي، وتسمح بعرض المعلومات المطلوبة متى طُلبت [11].
- اللائحة التنفيذية: تُحفظ السجلات «بطبيعتها، وبكامل بياناتها الأصلية»، وفق قواعد موثقة، مع حفظ احتياطي دوري، وصلاحيات اطلاع بحسب حاجة العمل، وتسجيل كل اطلاع أو تغيير [10، المواد 2 و5 و6].
حدود هذه القواعد: كُتبت لسجلات التعاملات الإلكترونية. أما إن كانت النسخة الممسوحة تغني عن أصل ورقي يُلزمك نظامٌ بحفظه، فهذا سؤال لمحاميك؛ ولا تُتلِف الأصول اعتمادًا على OCR. وخارج المملكة اسأل: هل النسخة مطابقة للأصل، ويمكن الرجوع إليها، ويُعرف مصدرها؟
صور الهويات وأين تذهب بياناتك
تُلزم المادة 31 من اللائحة التنفيذية لنظام حماية البيانات الشخصية جهةَ التحكم بالامتناع عن تصوير الوثائق الرسمية التي تحدد هوية صاحبها، الصادرة من الجهات العامة، أو نسخها، إلا بطلب من جهة عامة مختصة أو تنفيذًا لأحكام نظام، وبحمايتها وإتلافها فور انتهاء الغرض منها ما لم يوجد متطلب نظامي للاحتفاظ بها [12] (وانظر المادة 28 من النظام [8]). فلا تمسح الهوية الوطنية أو هوية مقيم (الإقامة) «احتياطًا»، وسجّل الرقم الذي تحتاجه فقط من الأصل المعروض عليك، إن احتجته.
ورفع المستندات إلى مواقع التحويل المجانية أو أدوات الذكاء الاصطناعي العامة يرسلها إلى خوادم جهة أخرى، ربما خارج المملكة. فإن كانت فيها بيانات شخصية، فتنطبق شروط النقل في المادة 29 من نظام حماية البيانات الشخصية، ومنها «أن يقتصر النقل أو الإفصاح على الحد الأدنى من البيانات الشخصية الذي تدعو الحاجة إليه» [8].
وتنص مبادئ سدايا للذكاء الاصطناعي التوليدي على أن تطبّق الجهات سياسات تمنع المستخدمين من إدخال معلومات مصنفة في أدوات خارجية [13، البند 5.4]، فاكتب لموظفيك قائمة بما لا يُدخَل في هذه الأدوات أبدًا.
ابدأ بنوع واحد من المستندات وقِس نسبة الأخطاء
ابدأ بنوع المستندات الذي يأخذ النصيب الأكبر من وقت فريقك، وتحقّق من صلاحيته عبر اختبار الأسئلة الأربعة. واجمع نحو 50 مستندًا حقيقيًا متفاوت الجودة (تقدير عملي، لا رقم إحصائي)، وقرّر نسب الخطأ التي تقبلها قبل أن ترى النتائج.
احتفظ بسجل اختبار، صف لكل مستند:
| المستند | جودة المسح (جيدة / متوسطة / ضعيفة) | الحقول المراجَعة | الحقول الخاطئة | أنواع الأخطاء | دقائق الاستخراج والمراجعة |
|---|---|---|---|---|---|
| 1 |
ثم احسب أربعة أرقام:
- نسبة أخطاء الحقول = الحقول الخاطئة ÷ الحقول المراجَعة. مثال حسابي فقط، لا نتيجة معتادة: 6 أخطاء في 400 حقل = 1.5%.
- النسبة نفسها للمسوح الضعيفة وحدها: إن كانت أعلى بكثير، فأصلح الخطوة 2 قبل تغيير الأداة.
- أخطاء فاتت المراجعة، من إعادة فحص موظف ثانٍ لعيّنة من حقول «دائمًا»: يجب أن تكون صفرًا قبل أن تعتمد على الناتج.
- الدقائق الموفَّرة شهريًا = (دقائق المستند يدويًا − دقائقه مع الاستخراج والمراجعة) × عدد المستندات في الشهر. قِس وقت 10 مستندات في كل طريقة، وخذ الوسيط (القيمة التي في المنتصف).
وإذا تركزت الأخطاء في نوع واحد، كالتواريخ، فأصلح قاعدته قبل تغيير الأداة. وإن كانت الدقائق الموفَّرة قليلة، فأبقِ المهمة يدوية.
خطوتك التالية
هذا الأسبوع، طبّق هذا الاختبار على نوع واحد من المستندات: جدول حقول من 8 إلى 10 حقول، و50 مستندًا حقيقيًا ممسوحًا وفق قائمة الخطوة 2. بهذه الأرقام تعرف ما يستطيعه OCR عربي على مستنداتك أنت. وإن أردت من يساعدك في ذلك، فهذه طريقة عمل O AI (أو إيه آي)، شركة ذكاء اصطناعي وبرمجيات سعودية:
ابدأ بمهمة واحدة بطيئة ومتكررة: المستندات، أو الرد على العملاء، أو التقارير، أو بيانات موزعة بين أنظمة. تدرس O AI هذه المهمة، وتقيّم جدوى الذكاء الاصطناعي فيها، ثم تدمجه في أنظمتك القائمة أو تبني نظامًا جديدًا. والاستشارة الأولى والعرض دون أي التزام.
أخبرنا بنوع المستندات الذي يستهلك معظم وقت فريقك، واحجز استشارة مجانية لنقيّم معك جدوى استخراج بياناته بالذكاء الاصطناعي. ونردّ عليك خلال يوم عمل واحد.
الأسئلة الشائعة
هل يمكن تحويل PDF عربي إلى وورد بدون أخطاء؟
لا يمكن ضمان ذلك إذا كان الملف ممسوحًا ضوئيًا. قلّصت نماذج الذكاء الاصطناعي الأحدث أخطاء الحروف كثيرًا، لكن أفضل نموذج في اختبار KITAB-Bench المنشور عام 2025 لم يحقق إلا نحو 65% في تحويل ملفات PDF عربية صعبة كاملة، بدرجة تجمع دقة النص ودقة الجداول. فإن كان الملف رقميًا بطبقة نص سليمة، فاستخرج النص مباشرة. وإن كان ممسوحًا، فاحرص على جودة المسح، واستخرج الحقول، وراجع الأسماء والأرقام والتواريخ.
هل يمكن تحويل PDF عربي ممسوح إلى Excel؟
نعم، وهو في الجداول أنسب من وورد غالبًا، لأن كل قيمة تقع في خلية مستقلة تراجعها وتجمعها. لكن راجع الجداول أكثر من النص العادي؛ فتحويل ملفات PDF كاملة بجداولها كان نقطة ضعف حتى لأفضل نموذج في اختبار KITAB-Bench عام 2025. استخرج الأعمدة التي تحتاجها فقط، ووحّد الأرقام في نوع واحد ليتمكن الجدول من فرزها وجمعها، وأعد جمع كل عمود وقارنه بالمجموع المطبوع. وإن كان الجدول صادرًا من نظام أو بنك، فاطلب ملف Excel أو CSV منه مباشرة.
هل يمكن ترجمة PDF عربي ممسوح ضوئيًا إلى الإنجليزية؟
نعم، لكن راجع النص العربي أولًا. فالترجمة تعمل على النص الذي أخرجه OCR، فينتقل الرقم أو التاريخ أو الاسم الخاطئ كما هو إلى النص الإنجليزي، حيث لن يكتشفه قارئ لا يعرف العربية. طبّق الخطوات من 2 إلى 4 قبل الترجمة، واحتفظ بالأسماء بالعربية بجانب كتابتها اللاتينية، وطابق المبالغ والتواريخ مع الصورة. وفي العقود وكل ما ستعتمد عليه، اجعل مترجمًا مؤهلًا يراجع النتيجة.
لماذا تظهر الحروف العربية متقطعة أو معكوسة عند النسخ من ملف PDF؟
لأحد سببين غالبًا: أن طبقة النص في الملف تخزّن الحروف بأشكال العرض، وهو ما لا يوصي به معيار يونيكود، أو بترتيب العرض بدل ترتيب القراءة؛ أو أن الأداة التي تنسخ بها أو تستخرج النص تعيد ترتيب الحروف من اليمين إلى اليسار خطأً، ففي اختبار لهذا المقال قلبت أداة استخراج مفتوحة المصدر كل لام وألف في ملف سعودي رسمي قرأته أداة أخرى سليمًا. جرّب أداة أخرى أولًا، فإن بقي الخلل فحوّل النص إلى الحروف القياسية أو شغّل OCR على صورة الصفحة، ثم طابق الأرقام مع الصورة.
ما أفضل برنامج OCR عربي؟
الأفضل هو ما يعطي أقل الأخطاء على مستنداتك أنت. فقد وجد اختبار KITAB-Bench (2025) أنه لا يوجد نموذج يتقدم في كل صعوبات العربية (الخطوط، والتشكيل، والتطويل، والنص المائل)، ويقرّ الباحثون بأنه لا يغطي السجلات الحكومية والمالية الممسوحة. ضيّق القائمة حسب النوع أولًا: برنامج OCR يعمل على أجهزتك يُبقي الملفات لديك؛ وخدمة سحابية لمعالجة المستندات بعقد مع شركتك قد تضيف استخراج الحقول ومؤشرات الثقة، فاسأل أين تُعالَج الملفات وتُحفظ، وإلى متى، وهل تُستخدم لتدريب النماذج؛ ومواقع التحويل المجانية لا تصلح إلا لصفحات ليس فيها شيء شخصي أو سري. ثم جرّب الأدوات التي تفاضل بينها على 50 مستندًا من ملفاتك نفسها، وقارن نسبة أخطاء الحقول والدقائق لكل مستند.
هل من الآمن رفع المستندات إلى مواقع OCR مجانية؟
لا، إذا كانت فيها بيانات شخصية أو سرية. فالملف يذهب إلى خوادم جهة أخرى، وربما خارج المملكة، وهنا تنطبق شروط النقل في المادة 29 من نظام حماية البيانات الشخصية، ومنها ألا يُنقل إلا الحد الأدنى من البيانات. وتنص مبادئ سدايا للذكاء الاصطناعي التوليدي على أن تطبّق الجهات سياسات تمنع إدخال المعلومات المصنفة في أدوات خارجية. واستخدم أداة بعقد مع شركتك تحدد أين تُعالَج الملفات وهل تُحفظ، أو أداة تعمل على أجهزتك. أما الوثائق الرسمية التي تحدد الهوية، فالأصل ألا تصوّرها أو تنسخها إلا بطلب جهة عامة مختصة أو تنفيذًا لنظام (المادة 31 من اللائحة التنفيذية للنظام).
هل يستطيع الذكاء الاصطناعي قراءة الخط العربي المكتوب باليد؟
جزئيًا، والنتيجة تتوقف على الخط وجودة الصورة؛ فخط اليد يختلف من كاتب إلى آخر، وكثيرًا ما تُحذف فيه الحركات. ويشمل اختبار KITAB-Bench نصوصًا مكتوبة باليد، لكن الفيصل هو التجربة على عيّنة من مستنداتك. واعتبر ناتج الخط اليدوي اقتراحًا وراجع كل حقل فيه، وللأعداد القليلة قد يكون الإدخال اليدوي أسرع.
هل يمكن التخلص من الأصل الورقي بعد مسحه ضوئيًا؟
لا تفعل ذلك اعتمادًا على OCR. يضع نظام التعاملات الإلكترونية السعودي شروطًا ليُعد السجل الإلكتروني محفوظًا وأصلًا بذاته (المادتان 6 و8)، ويستثني تعاملات بعينها من أحكامه (المادة 3). اسأل محاميك عن الأصول التي يلزمك حفظها، وإن كنت تعمل خارج المملكة فراجع أنظمة بلدك.
كيف أُعدّ هذا المقال: أُعدّ من المصادر المذكورة أدناه، واطُّلع عليها في 29 سبتمبر 2026، ومن اختبارات لاستخراج النص وتحويل التواريخ أُجريت لهذا المقال. صيغت المسودة بمساعدة الذكاء الاصطناعي، ثم طوبقت مع المصادر. الصور توضيحية مولّدة بالذكاء الاصطناعي.
المصادر
- Advancements and Challenges in Arabic Optical Character Recognition: A Comprehensive Survey، Kasem وMahmoud وKang (ديسمبر 2023، بالإنجليزية) (يفتح في نافذة جديدة)أرشيف arXiv (نسخة أولية) · arxiv.org
- KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding، Findings of ACL 2025 (بالإنجليزية) (يفتح في نافذة جديدة)رابطة اللغويات الحاسوبية (ACL Anthology) · aclanthology.org
- FAQ: Ligatures, Digraphs and Presentation Forms (بالإنجليزية) (يفتح في نافذة جديدة)اتحاد يونيكود (Unicode Consortium) · unicode.org
- FAQ: Arabic Script (بالإنجليزية) (يفتح في نافذة جديدة)اتحاد يونيكود (Unicode Consortium) · unicode.org
- الدليل الإرشادي التفصيلي للفوترة الإلكترونية (النسخة الثانية، مايو 2023) (يفتح في نافذة جديدة)هيئة الزكاة والضريبة والجمارك · zatca.gov.sa
- Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR، Hennara وآخرون (سبتمبر 2025، بالإنجليزية) (يفتح في نافذة جديدة)أرشيف arXiv (نسخة أولية) · arxiv.org
- 36 CFR Part 1236, Subpart E: Digitizing Permanent Federal Records (بالإنجليزية) (يفتح في نافذة جديدة)الإدارة الوطنية للأرشيف والسجلات في الولايات المتحدة (NARA) · ecfr.gov
- نظام حماية البيانات الشخصية (النص الرسمي شاملًا التعديلات الصادرة بالمرسوم الملكي م/148) (يفتح في نافذة جديدة)هيئة الخبراء بمجلس الوزراء · laws.boe.gov.sa
- BCP 47 calendar identifiers (calendar.xml) (بالإنجليزية) (يفتح في نافذة جديدة)مشروع Unicode CLDR · github.com
- اللائحة التنفيذية لنظام التعاملات الإلكترونية (الإصدار 1.1، 2024) (يفتح في نافذة جديدة)هيئة الحكومة الرقمية · dga.gov.sa
- نظام التعاملات الإلكترونية (المرسوم الملكي م/18 بتاريخ 8/3/1428هـ) (يفتح في نافذة جديدة)هيئة الخبراء بمجلس الوزراء · laws.boe.gov.sa
- اللائحة التنفيذية لنظام حماية البيانات الشخصية (يفتح في نافذة جديدة)الهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا) · sdaia.gov.sa
- مبادئ الذكاء الاصطناعي التوليدي للعموم (مايو 2025) (يفتح في نافذة جديدة)الهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا) · sdaia.gov.sa
AI


