ما هي تحليلات الفيديو؟ مدخل إلى تقنية التحليل المرئي
ما هي تحليلات الفيديو وكيف تعمل؟ أساسيات تقنية تحليل الكاميرات المدعومة بالذكاء الاصطناعي ومجالات استخدامها.
مترجم عن الأصل التركي · Türkçe aslı
تحليلات الفيديو — أو التحليل المرئي — هي التقنية التي تحوّل صورة الكاميرا من تسجيل يُشاهَد إلى مصدر بيانات يُنتج القرارات. فنماذج التعلّم العميق تكتشف الأجسام في كل إطار، وتتتبّعها عبر الزمن، وتُولّد أحداثًا وفق قواعد محددة: تنبيه بمخالفة، أو بيانات عدّ، أو سجل جودة. وبدلًا من مشغّل يراقب الشاشة باستمرار، لا يُبلغ النظام إلا حين يقع أمر ذو معنى.
كيف تعمل تحليلات الفيديو؟
تتألف السلسلة في كل مشروع من الحلقات الأربع نفسها. الأولى مصدر الصورة: كاميرا IP في المنشأة تبثّ الصورة على شكل تدفق RTSP، ويكون التدفق عادةً مضغوطًا بترميز H.264 أو H.265. الثانية وحدة المعالجة: يفكّ خادم طرفي (edge) داخل المنشأة ترميز التدفق ويمرّر الإطارات إلى النموذج العامل على وحدة GPU — وقد شرحنا تفاصيل هذه البنية في مقال تدفق RTSP ووحدة GPU الطرفية. الثالثة النموذج: يحيط في كل إطار بفئات مثل الإنسان والمركبة والرافعة الشوكية والخوذة والسترة والدخان داخل مربعات؛ والعائلة الأكثر استخدامًا في الميدان هي الكواشف أحادية المرحلة (اكتشاف الأجسام باستخدام YOLO). الرابعة محرك القواعد: يجعل ما يراه النموذج ذا معنى بلغة المنشأة.
العمل الحقيقي يدور في الحلقة الرابعة. فمعلومة «يوجد شخص في الإطار» لا تعني شيئًا بمفردها؛ أما «شخص بلا خوذة يقف منذ مدة معينة في منطقة محظورة أثناء عمل الرافعة الشوكية» فهو حدث. يحتفظ محرك القواعد برسومات المناطق وعتبات المدة وجدول الورديات وخطوط العدّ. وعند وقوع الحدث يُنتَج مقطع مختوم بالوقت، ومؤشر على لوحة المتابعة، ورسالة API؛ فيرى المشغّل التنبيه مع مقطعه ويتخذ القرار.
الفرق عن كشف الحركة التقليدي
يعتمد كشف الحركة في أجهزة التسجيل على تغيّر البكسلات: فالمظلة القماشية التي تتمايل مع الريح، وأضواء المركبات، وظل السحب، كلها تُطلق إنذارًا. أما تحليلات الفيديو فتصنّف ما الذي يتحرك؛ فتميّز الشخص من الظل، والرافعة الشوكية من عربة الحمولة. وفوق ذلك لا يُولَّد الحدث من إطار واحد — بل يُنتظَر استمرار الشرط لعدد معين من الإطارات ولمدة معينة. ونافذة الزمن هذه هي الآلية الأساسية التي تمنع الإنذارات الكاذبة من إرهاق المشغّل. وتُراجَع الإيجابيات الكاذبة يوميًا طوال المرحلة التجريبية، وتُضبط العتبات بحسب الموقع.
لماذا الآن؟
تقاطعت ثلاثة منحنيات في آن واحد: انخفضت تكلفة وحدات GPU، ونضجت معماريات النماذج المفتوحة، وكانت ملايين الكاميرات مركّبة أصلًا في المنشآت. واليوم تتحول حتى كاميرا IP عمرها 10 سنوات إلى عين ذكاء اصطناعي تعمل في الزمن الحقيقي بفضل خادم طرفي يُضاف خلفها — دون تغيير في العتاد.
ويجب أن يُضاف إلى ذلك عامل رابع: أصبح تدريب النماذج ببيانات الموقع عملًا تستطيع الفرق الصغيرة إنجازه. فدورة التدريب التي لم تكن تقدر على تنفيذها قبل بضع سنوات سوى مجموعات البحث الكبيرة، تسير اليوم بصور تُجمع من الموقع ووسم دقيق وخادم GPU واحد. وهذا يعني أن المشكلات الخاصة بالمنشأة، التي لا تغطيها المنتجات الجاهزة، أصبحت قابلة للحل.
مجالات الاستخدام
في السلامة المهنية: معدات الوقاية الشخصية ومراقبة المناطق؛ وفي الأمن: الحريق والمحيط والتعرف على لوحات المركبات؛ وفي الإنتاج: OEE ومراقبة الجودة والعدّ؛ وفي التجزئة: عدّ الأشخاص والخريطة الحرارية وإدارة الطوابير. ونحن في CX Teknoloji نُنشئ في جميع هذه المجالات حلولًا جرى التحقق منها في الميدان.
ومع أن المجالات تبدو مختلفة، فإن أنواع المخرجات تنحصر في ثلاثة عناوين. الأول التنبيه: إشعار فوري عند مخالفة قاعدة ما — دخول بلا خوذة، أو دخول منطقة محظورة، أو دخان. الثاني القياس: تحويل عملية ما إلى أرقام باستمرار — مدة توقف الآلة، والانتظار عند الصندوق، وعدد الأشخاص الداخلين إلى المتجر. الثالث الدليل: مقطع يُظهر متى وكيف وقع حدث ما — اعتراض على شحنة، أو تحقيق في حادث عمل، أو تدقيق. ويمكن للكاميرا نفسها أن تخدم أكثر من مخرج؛ فكاميرا عند مدخل المستودع مثلًا تُطلق تنبيهًا عند اقتراب الرافعة الشوكية من المشاة، وتحفظ في الوقت ذاته مقطع دليل في منطقة الشحن. والسؤال الأول عند تصميم المشروع هو: أيّ هذه الثلاثة هي الحاجة؟ فكل شيء، من زاوية الكاميرا إلى تواتر التقارير، يتغيّر تبعًا لذلك.
حل جاهز أم نموذج مخصص للمشروع؟
في الاحتياجات الشائعة مثل معدات الوقاية الشخصية والحريق وعدّ الأشخاص، تُعايَر النماذج المدرَّبة مسبقًا بحسب الموقع. لكن بعض المشكلات لا توجد إلا في تلك المنشأة: نوع عيب لا يظهر إلا على ذلك الخط، أو حركة لا معنى لها إلا في ذلك الموقع. وفي هذه الحالة يأتي دور تحليلات الفيديو المخصصة للمشروع. تبدأ العملية بدراسة الجدوى: يُحدَّد بوضوح ما يمكن قياسه بالصورة الحالية، وأيّ دقة واقعية، وما تكلفة الوسم. ويُطلَق المشروع المخصص النموذجي في غضون 12–14 أسبوعًا، وأكبر بند في المدة ليس النموذج بل البيانات؛ فالتقاط الحالات النادرة هو ما يحدد جودة المشروع.
كيف تُقاس الدقة؟
نسبة الدقة في الكتيّب لا تقول شيئًا عن موقعك؛ فالإضاءة وزاوية الكاميرا والمسافة وسير العمل تختلف في كل منشأة. الدقة قيمة ميدانية لا مخبرية: طوال المرحلة التجريبية تُوسَم الأحداث الحقيقية يدويًا وتُقارَن باكتشافات النظام. ويُعرَّف كتابيًا منذ البداية ما الذي يُعدّ «اكتشافًا صحيحًا»، وما مقدار الإنذارات الكاذبة المقبول، وعلى أيّ مجموعة بيانات سيُجرى الاختبار. وفي النماذج المخصصة يرتفع المنحنى طوال المرحلة التجريبية؛ فالمنحنى النموذجي في صفحتنا يسلك مسار 71% → 94%، لأن الاكتشافات الخاطئة الواردة من الموقع كل أسبوع تُضاف إلى بيانات التدريب.
خصوصية البيانات وKVKK
لأن صورة الكاميرا قد تتضمن بيانات شخصية، فإنها تُقيَّم في إطار قانون حماية البيانات الشخصية رقم 6698 (KVKK، قانون حماية البيانات الشخصية التركي). والبنية الافتراضية في منشآتنا هي معالجة الصورة على الخادم الطرفي داخل المنشأة؛ ولا يُرسَل فيديو خام إلى السحابة. لا يُستخدم التعرف على الوجوه، والمخرجات التحليلية مجهولة الهوية، وتُحذف مقاطع الأحداث تلقائيًا عند انتهاء مدة الاحتفاظ المحددة. أما مسائل مثل نص الإفصاح ومدة الاحتفاظ وتعريف الصلاحيات فهي من قرار الوحدة القانونية في المؤسسة نفسها؛ وقد جمعنا الإطار العام في مقال KVKK ومعالجة الصور — وهذه المعلومات لا تحلّ محل الاستشارة القانونية.
ما المطلوب للبدء؟
الخطوة الأولى ليست شراء كاميرات جديدة، بل النظر في مخزون الكاميرات الحالي. أيّ كاميرا يمكن استخدامها كما هي، وأيّها يجب تغيير زاويتها، وأين تلزم كاميرا جديدة — نُجري هذا التقييم مجانًا. بعد ذلك يتضح المؤشر المراد قياسه، وتُرسم المناطق مع فريق الموقع، وتبدأ المرحلة التجريبية. وقد شرحنا ترتيب الخطوات وما يُتخذ من قرار في كل منها خطوة بخطوة في مقال مراحل التركيب.
الأسئلة الشائعة
هل يمكن استخدام تحليلات الفيديو مع كاميراتنا الحالية؟
في معظم الحالات نعم. فكاميرات IP التي تبثّ تدفق RTSP يمكن تحليلها بخادم طرفي يُضاف خلفها؛ وحتى الكاميرات التي عمرها 10 سنوات قد تدخل ضمن هذه الفئة. والعامل الحاسم ليس العلامة التجارية، بل أن يكون الجسم المراد قياسه كبيرًا وواضحًا بما يكفي في الصورة، وأن تكون الزاوية والإضاءة مناسبتين. قبل التركيب نقيّم مخزون كاميراتكم مجانًا، ونعدّ تقريرًا بالنقاط المناسبة وبالكاميرا التي يلزم إضافتها عند الحاجة.
هل تُرسَل الصور إلى السحابة، وما الوضع من حيث KVKK؟
في التركيب الافتراضي تُعالَج الصورة على الخادم الطرفي داخل المنشأة، ولا يُرسَل فيديو خام إلى السحابة. لا يُستخدم التعرف على الوجوه؛ والمخرجات التحليلية مجهولة الهوية، وتُحذف مقاطع الأحداث تلقائيًا عند انتهاء مدة الاحتفاظ المحددة. أما قرارات مثل نص الإفصاح ومدة الاحتفاظ فتُتخذ في الوحدة القانونية للمؤسسة؛ ونحن نهيّئ الجانب التقني وفقًا لهذه القرارات. وهذه المعلومات ليست استشارة قانونية.
كم ستكون دقة النظام؟
تعتمد الدقة على الموقع وتُقاس في المرحلة التجريبية على كاميراتكم أنتم. تُوسَم الأحداث الحقيقية يدويًا، وتُقارَن باكتشافات النظام، وتُرفع النتيجة في تقرير. ويُعرَّف كتابيًا في بداية المرحلة التجريبية ما الذي يُعدّ اكتشافًا صحيحًا ومستوى الإنذارات الكاذبة المقبول. وتُعايَر العتبات بحسب الموقع طوال المرحلة التجريبية؛ وفي النماذج المخصصة ترتفع الدقة كلما أُضيفت الاكتشافات الخاطئة الواردة من الموقع إلى التدريب.
هل يتكامل مع نظام VMS أو MES أو الإنذار الحالي لدينا؟
نعم. تُنشر الأحداث عبر REST API وMQTT؛ وبذلك يمكن ربطها بالبنية الحالية لأنظمة MES وERP وVMS والإنذار. ولأن جانب الكاميرا يستخدم تدفق RTSP القياسي، يواصل نظام التسجيل الحالي عمله كما هو؛ إذ لا تقرأ التحليلات إلا نسخة من التدفق. وفي جانب الإنتاج يمكن أيضًا التكامل مع MES وERP/SAP وPower BI.
كم يستغرق التركيب؟
في الحلول الجاهزة يكتمل التركيب، مع تقييم الكاميرات ورسم المناطق، عادةً في غضون أسبوع واحد؛ ثم تُحقَّق في المرحلة التجريبية التالية ومدتها 30 يومًا نتائج قابلة للقياس بالكاميرات الحالية. ويُخصَّص الأسبوع الأول من المرحلة التجريبية عادةً للمعايرة؛ فتُحدَّد مصادر الإنذارات الكاذبة وتُضبط العتبات. وفي المشاريع التي تتطلب نموذجًا خاصًا بالموقع، تبلغ مدة التشغيل النموذجية 12–14 أسبوعًا لإضافة جمع البيانات والوسم.