IA
Au cœur de ZetAI Vision : lire un échange de badminton à 240 images par seconde
Un volant quitte la raquette à plus de 300 km/h. Le suivre, classer le coup et détecter la frontière de l'échange, ce sont trois problèmes, pas un.
Un volant smashé quitte la raquette à plus de 300 kilomètres à l'heure et décélère plus vite que presque tout objet du sport. À 30 images par seconde, c'est une traînée sur deux images, puis il disparaît. Rien d'utile ne peut en être tiré.
C'est pourquoi ZetAI Vision fonctionne à 240 i/s, et pourquoi la cadence d'images n'est pas un détail de spécification mais l'élément autour duquel toute la conception s'organise.
Trois problèmes sous un même manteau
« La vision par ordinateur pour le sport » semble une capacité unique. En pratique, un échange doit être décomposé en trois tâches qui n'ont presque rien en commun.
- Détection et suivi — où sont les joueurs, les raquettes et le volant dans cette image, et lequel est lequel d'une image à l'autre. Spatial, image par image, extrêmement sensible à la latence.
- Classification des événements — était-ce un smash, une amortie, un dégagement ou un jeu de filet ? Temporel, nécessite une fenêtre d'images, et doit comprendre l'intention à partir de la position du corps autant que de la trajectoire du volant.
- Segmentation — où un échange se termine-t-il et où le suivant commence-t-il ? Structurel, et c'est de lui que dépend tout l'aval, car une frontière d'échange mal détectée corrompt toutes les statistiques qui en découlent.
Le troisième est celui qui surprend. Se tromper d'un coup sur la frontière ne dégrade pas légèrement l'analyse ; cela décale toute l'attribution de qui a gagné quel échange, ce qui invalide complètement les données de schémas.
La prédiction comble les trous
Même à 240 i/s, le volant est parfois perdu — masqué par un joueur, noyé dans un fond lumineux, ou simplement trop rapide au moment de l'impact. Le suiveur maintient un modèle physique du vol du volant, avec son profil de traînée exceptionnellement marqué, et prédit à travers le trou. Quand la détection reprend, la position observée corrige le modèle. Une trajectoire observée à 85 % et prédite à 15 % reste exploitable ; une trajectoire qui se brise à chaque fois que le volant est masqué ne l'est pas.
Pourquoi l'inférence en périphérie, et pas dans le cloud
Téléverser de la vidéo à 240 i/s de huit courts vers un GPU dans le cloud n'est pas viable dans un site départemental. La bande passante n'existe pas, et même là où elle existe, l'aller-retour détruit le budget de latence qui rend possibles les habillages en direct et l'auto-scoring.
L'inférence s'exécute donc sur le site, sur du matériel placé près des caméras. Les modèles sont quantifiés pour tenir le budget de moins de 10 ms sur un matériel modeste, et ce qui quitte le site n'est pas de la vidéo mais des événements structurés — quelques centaines d'octets décrivant ce qui s'est passé, plutôt que des gigaoctets décrivant à quoi cela ressemblait.
Cela compte aussi pour une raison sans rapport avec l'ingénierie : les images brutes de mineurs pratiquant un sport sont des données qui ne devraient pas quitter inutilement un gymnase scolaire. Traiter en périphérie et transmettre des événements permet de garder la vidéo en local par défaut.
Ce qu'elle produit
- Reconstitution des échanges coup par coup — chaque frappe, son type, sa vitesse et son point de chute.
- Cartes de chaleur de couverture du court — où un athlète passe réellement son temps, par rapport à où il pense le passer.
- Schémas de déplacement et de récupération — la rapidité avec laquelle un joueur revient en position de base, et comment cela se dégrade au fil d'un match.
- Moments clés automatiques — les longs échanges et les retournements de dynamique dont s'alimentent à la fois la génération de temps forts et l'analyse de match.
- Signaux de scoring que ZetAI Score utilise pour proposer des points à l'arbitre.
Des limites assumées
La qualité de la vision dépend davantage de l'emplacement des caméras que de la qualité du modèle. Une seule caméra à une extrémité du court produit une segmentation d'échanges exploitable et des données spatiales médiocres ; deux caméras aux coins opposés produisent de bonnes données spatiales. Nous préférons le dire plutôt que de laisser une fédération acheter un système et s'en apercevoir au deuxième mois.
L'éclairage compte énormément — une salle mêlant lumière du jour et éclairage fluorescent provoque à haute cadence un scintillement qu'il faut compenser. Et les modèles sont les plus solides dans les sports de raquette, où nous disposons du plus grand nombre de données annotées, et plus minces dans les sports ajoutés récemment. Cet écart se réduit avec l'usage, mais il est bien réel aujourd'hui.