الحقيقة أن التقدم الهائل الذي شهده الذكاء الاصطناعي في الآونة الأخيرة مذهلٌ حقاً. ويتجلى ذلك بوضوح في مجال رؤية الحاسوب ، حيث مكّن التعلم العميق الآلات ليس فقط من رؤية وحدات البكسل، بل أيضاً من فهم محتوى الصور، متجاوزاً في بعض الحالات دقة العين البشرية في مهام التصنيف والكشف.
بالنسبة لأي شركة أو مطور، يُعد اختيار الأداة المناسبة تحديًا حقيقيًا، إذ يختلف أتمتة مراقبة الجودة في المصانع اختلافًا كبيرًا عن الحاجة إلى نظام للتعرف على الوجوه أو جهاز تحليل الأشعة السينية الطبية. وتختلف الخيارات المتاحة اختلافًا هائلًا، سواء كنت تبحث عن حل جاهز قائم على الحوسبة السحابية أو عن شيء يمكنك تطويره بنفسك من الصفر.
المفاهيم الأساسية: التصنيف، الكشف، أم التجزئة؟
لتجنب الوقوع في خطأ عند الاختيار، من الضروري تحديد احتياجاتنا بدقة. يُعدّ تصنيف الصور أبسط أنواع التصنيفات: ينظر النموذج إلى الصورة كاملةً ويقول: "هذا كلب". إنها مجرد تسمية واحدة للصورة بأكملها. مع ذلك، إذا احتجنا إلى معرفة مكان هذا الكلب وعدد الكلاب الموجودة، فإننا ندخل مجال اكتشاف الكائنات ، والذي يمكن تحقيقه حتى من خلال التعرّف على الكائنات من كاميرا الويب ، ورسم مربع محيط بكل عنصر.
إذا كنا نسعى إلى دقة جراحية، فإن التجزئة الدلالية هي الحل الأمثل . لا وجود للمربعات هنا؛ بل يقوم الذكاء الاصطناعي بتصنيف كل بكسل على حدة، مما يسمح بفصل الجسم عن الخلفية بدقة مذهلة. كل هذا مدعوم حاليًا بشبكات عصبية التفافية (CNNs) ، التي تحاكي القشرة البصرية البشرية من خلال استخراج الحواف والنسيج أولًا، ثم التعرف على الأشكال المعقدة.
صراع العمالقة: AWS ضد Google Cloud ضد Azure
إذا كنا لا نرغب في تعقيد الأمور بتدريب النماذج، فإن الخيار الأسهل هو استخدام واجهات برمجة التطبيقات (APIs) الخاصة بمزودي الخدمات السحابية الرئيسيين. ولكل منها نقاط قوتها وضعفها.
- التعرف على أمازون: لقد رسخت مكانتها بقوة في القطاع الصناعي، وهي تتمتع بنفوذ خاص في الكشف عن معدات الحماية الشخصية (PPE)مثل الخوذات أو القفازات، متفوقة بذلك على منافسيها في هذا المجال. وتنقسم خدماتها بين تحليل المحتوى والتحقق من الوجه.
- رؤية Google Cloud: هو ملك فهم عام للصورإنه متفوق في أدوات التعرف الضوئي على الأحرف (التعرف على النصوص)، واكتشاف المعالم، والبحث العكسي على الويب. وهو يدعم مجموعة أوسع بكثير من تنسيقات الملفات مقارنة بالمنافسين.
- رؤية مايكروسوفت أزور للذكاء الاصطناعي: يركز كثيراً على مخرجات اللغة الطبيعية، حيث يقدم ترجمة كثيفة ووصفًا تفصيليًا لما يحدث في المشهد، على الرغم من أنه قد يعاني أكثر مع الأشياء الصغيرة جدًا أو القريبة جدًا.
في اختبارات الأداء العملية، أظهرت أمازون باستمرار دقةً أكبر في تحديد مواقع الصناديق (نقاط خريطة أفضل)، بينما تُقدم جوجل دقةً عاليةً جدًا في التصنيفات العامة. ومن المثير للاهتمام، أنه بدون تدريب مُخصص، تفشل الأنظمة الثلاثة فشلاً ذريعًا عند محاولة اكتشاف أقنعة الوجه، مما يُظهر قصور الإعدادات الافتراضية.
بدائل المصادر المفتوحة وقوة الذكاء الاصطناعي على الحافة
بالنسبة لمن يحتاجون إلى تحكم كامل أو خصوصية مطلقة، فإن واجهات برمجة التطبيقات السحابية ليست الخيار الأمثل. هنا تبرز أهمية أدوات مثل Ultralytics YOLO ، التي تتميز بسرعة ودقة فائقتين، ما يجعلها مثالية للتطبيقات التي تعمل في الوقت الفعلي. ومن الأدوات المميزة الأخرى AISee ، وهي مكتبة بايثون مبنية على PyTorch و timm، تتيح ضبط النماذج المتطورة بدقة متناهية باستخدام عدد قليل جدًا من أسطر البرمجة.
علاوة على ذلك، يشهد الحوسبة الطرفية، أو الذكاء الاصطناعي الطرفي ، نموًا سريعًا . فبدلًا من إرسال الصورة إلى خادم بعيد، يُشغَّل النموذج على الجهاز نفسه (مثل الكاميرا الذكية أو الهاتف المحمول). وهذا أمر بالغ الأهمية لتقليل زمن الاستجابة ، وتوفير عرض النطاق الترددي، وضمان عدم مغادرة البيانات الحساسة، مثل الصور الطبية أو الأمنية، للموقع.
حالات الاستخدام والقيود في العالم الحقيقي
لم يعد الذكاء الاصطناعي البصري ضربًا من الخيال العلمي، بل أصبح واقعًا ملموسًا في كل مكان. ففي الزراعة، تُستخدم الطائرات المسيّرة لمراقبة المحاصيل والكشف عن الآفات قبل ظهورها للعين المجردة. وفي قطاع التأمين، تعمل تقنية التعرف الضوئي على الأحرف (OCR) على أتمتة قراءة الوثائق ، مثل رخص القيادة، مما يقلل وقت المعالجة إلى النصف تقريبًا. كما أنها تُعدّ أساسية في مراقبة محتوى وسائل التواصل الاجتماعي ، حيث تقوم تلقائيًا بتصفية الصور العنيفة أو غير اللائقة.
مع ذلك، لا تزال هذه التقنية غير مثالية. تكمن نقطة ضعفها الرئيسية في فقدان التفاصيل في الأجسام الصغيرة ؛ فعندما يشغل عنصر ما مساحة صغيرة جدًا في الصورة، تميل الشبكات العصبية التلافيفية إلى تجاهله أو اعتباره ضوضاء خلفية. علاوة على ذلك، هناك خطر التحيز في التدريب : فإذا لم يرَ النموذج أمثلة كافية لجسم ما بأحجام مختلفة، فلن يتعرف عليه في الواقع.
يُبشّر التطور نحو تقنية تحويل الرؤية (ViT) بمعالجة بعض هذه المشكلات، إذ تعالج الصور على شكل أجزاء وتفهم السياق العام بشكل أفضل من الشبكات العصبية التلافيفية التقليدية. في نهاية المطاف، سواءً أكان الخيار هو سهولة استخدام واجهة برمجة التطبيقات المُدارة أو التوجه نحو المصادر المفتوحة بنماذج مُخصصة، فقد أصبحت القدرة على معالجة البيانات المرئية ميزة تنافسية لا غنى عنها لأي شركة حديثة.
كاتب شغوف بعالم البايت والتكنولوجيا بشكل عام. أحب مشاركة معرفتي من خلال الكتابة، وهذا ما سأفعله في هذه المدونة، لأعرض لك كل الأشياء الأكثر إثارة للاهتمام حول الأدوات الذكية والبرامج والأجهزة والاتجاهات التكنولوجية والمزيد. هدفي هو مساعدتك على التنقل في العالم الرقمي بطريقة بسيطة ومسلية.



