الذكاء الاصطناعي
داخل ZetAI Vision: قراءة تبادل في الريشة الطائرة بسرعة 240 إطارًا في الثانية
تغادر الريشة المضرب بسرعة تزيد على 300km/h. وتتبعها وتصنيف الضربة واكتشاف حد التبادل ثلاث مشكلات لا واحدة.
تغادر الريشة المضرب بعد ضربة ساحقة بسرعة تزيد على 300 كيلومتر في الساعة وتتباطأ أسرع من أي جسم تقريبًا في الرياضة. وعند 30 إطارًا في الثانية تصبح لطخة عبر إطارين ثم تختفي. ولا يمكن استخلاص شيء مفيد من ذلك.
ولهذا يعمل ZetAI Vision بسرعة 240fps، ولهذا فإن معدل الإطارات ليس تفصيلًا في المواصفات بل هو ما يدور حوله التصميم كله.
ثلاث مشكلات في معطف واحد
«الرؤية الحاسوبية للرياضة» تبدو قدرة واحدة. أما عمليًا فيجب تفكيك التبادل إلى ثلاث مهام لا يجمع بينها تقريبًا شيء.
- الكشف والتتبع: أين اللاعبون والمضارب والريشة في هذا الإطار، وأيها أيّ عبر الإطارات. مكاني، لكل إطار، شديد الحساسية للتأخير.
- تصنيف الأحداث: هل كانت تلك ضربة ساحقة أم إسقاطًا أم تخليصًا أم ضربة شبكة؟ زمني، يحتاج إلى نافذة من الإطارات، ويحتاج إلى فهم النية من وضع الجسم بقدر ما يفهمها من مسار الكرة.
- التقسيم: أين ينتهي تبادل وأين يبدأ التالي؟ بنيوي، وهو الذي يعتمد عليه كل ما بعده، لأن حدّ تبادل مكتشَف خطأً يفسد كل إحصائية مشتقة منه.
الثالثة هي التي تفاجئ الناس. فالخطأ في الحد بضربة واحدة لا يُضعف التحليل قليلًا، بل يزيح نسبة من فاز بأي تبادل كاملة، وهذا يُبطل بيانات الأنماط تمامًا.
التنبؤ يسد الفجوات
حتى عند 240fps تضيع الريشة أحيانًا: يحجبها لاعب، أو تضيع على خلفية ساطعة، أو تتحرك ببساطة بسرعة كبيرة لحظة الارتطام. ويحافظ جهاز التتبع على نموذج فيزيائي لطيران الريشة، بما في ذلك نمط مقاومتها الهوائية الحاد على غير المعتاد، ويتنبأ عبر الفجوة. وحين يستأنف الكشف، يصحح الموضع الملحوظ النموذج. والمسار المرصود بنسبة 85% والمتنبَّأ به بنسبة 15% يظل مسارًا صالحًا للاستخدام؛ أما الذي ينقطع كلما حُجبت الريشة فلا.
لماذا الاستدلال على الحافة لا السحابة
رفع فيديو بسرعة 240fps من ثمانية ملاعب إلى معالج رسوميات سحابي غير عملي في صالة محلية. فعرض النطاق غير موجود، وحتى حيث يوجد فإن الذهاب والإياب يهدم ميزانية التأخير التي تجعل العروض المباشرة والاحتساب الآلي ممكنين.
لذلك يجري الاستدلال في الصالة، على عتاد بجوار الكاميرات. وتُكمَّم النماذج لبلوغ ميزانية أقل من 10ms على عتاد متواضع، وما يغادر الصالة ليس فيديو بل أحداثًا منظمة، بضع مئات من البايتات تصف ما حدث بدل غيغابايتات تصف شكله.
وهذا يهم أيضًا لسبب لا علاقة له بالهندسة: فاللقطات الخام لقاصرين يمارسون الرياضة بيانات لا ينبغي أن تغادر صالة مدرسة دون ضرورة. والمعالجة على الحافة وإرسال الأحداث يعنيان أن الفيديو يبقى محليًا افتراضيًا.
ما الذي ينتجه
- إعادة بناء التبادل ضربةً بضربة: كل ضربة، ونوعها، وسرعتها، وأين سقطت.
- خرائط حرارية لتغطية الملعب: أين يقضي الرياضي وقته فعلًا، مقابل أين يظن أنه يقضيه.
- أنماط الحركة والتعافي: مدى سرعة عودة اللاعب إلى موضعه، وكيف يتراجع ذلك على مدار المباراة.
- اللحظات الحاسمة التلقائية: التبادلات الطويلة وتحولات الزخم التي يعتمد عليها توليد اللقطات المميزة وتحليل المباراة معًا.
- إشارات الاحتساب التي يستخدمها ZetAI Score لاقتراح النقاط على الحكم.
قيود بصراحة
تتبع جودة الرؤية موضع الكاميرا أكثر من جودة النموذج. فكاميرا واحدة في أحد طرفي الملعب تنتج تقسيمًا صالحًا للتبادلات وبيانات مكانية ضعيفة؛ وكاميرتان في ركنين متقابلين تنتجان بيانات مكانية جيدة. نفضّل قول ذلك على أن يشتري اتحاد نظامًا ويكتشفه في الشهر الثاني.
للإضاءة أهمية كبيرة: فالصالة التي تجمع ضوء النهار والإضاءة الفلورية تسبب وميضًا عند معدلات الإطارات العالية يجب تعويضه. والنماذج أقوى في رياضات المضرب، حيث لدينا أكبر قدر من البيانات الموسومة، وأضعف في الرياضات التي أضفناها حديثًا. وهذه الفجوة تضيق مع الاستخدام، لكنها حقيقية اليوم.