
U-Net
Sur le prototypeResNet-18 backbone
Segmente les lignes peintes, pour que l'appareil sache où va le couloir et où vous êtes dedans.
84.23% IoUIoU, jeu de validation
RunSightTechnologie
Comment une image devient géométrie, la géométrie une décision et la décision une phrase courte, le tout sur un appareil dans votre dos et sans internet.
Caméra RVB USB
Accélérateur Hailo-8
Perception à trois modèles

U-Net

YOLOv8n

Sc-Depth V3
Géométrie de la piste et des obstacles
Moteur d’instructions
Guidage vocal
Une caméra USB au niveau des yeux envoie des images à un accélérateur Hailo-8. Trois modèles compilés tournent sur chaque image conservée : l'un segmente les lignes peintes du couloir, l'un détecte les personnes devant, l'un estime la profondeur à partir de la même image. Pas de capteur de profondeur, pas de LiDAR, pas de seconde caméra. La profondeur vient de l'unique caméra RGB, ce qui garde l'appareil abordable.
Les images sont traitées selon la règle du plus frais. Si l'inférence prend du retard, les images périmées sont jetées plutôt que mises en file : mieux vaut se taire que guider depuis le passé.

ResNet-18 backbone
Segmente les lignes peintes, pour que l'appareil sache où va le couloir et où vous êtes dedans.
84.23% IoUIoU, jeu de validation

Nano detector
Repère les personnes sur la piste devant, car ce sont les obstacles qui comptent vraiment dans un couloir partagé.
88.24% IoUIoU, jeu de validation

Monocular RGB
Estime la distance d'une personne détectée à partir d'une seule image RGB, pour que le moteur de guidage sache si un obstacle est assez proche pour compter.
Self-supervisedprofondeur monoculaire, sur l'appareil


Un masque et quelques boîtes ne font pas un guidage. Il faut de la géométrie : où va le couloir, où vous êtes dedans, à quel point il tourne, et si la personne devant est assez proche pour compter.

01
Les contours sont extraits du masque et chaque ligne est ajustée par une courbe quadratique, ce qui permet de reconstituer en un bord continu une ligne coupée par une personne ou une ombre.

02
Les lignes ajustées découpent la piste en cinq zones : extrême gauche, gauche, centre, droite et extrême droite. Elles situent ensuite le coureur dans l'une d'elles. C'est de là que vient la consigne de direction.

03
Le rayon de courbure est calculé à partir des points centraux des lignes ajustées. Grand rayon : la piste est droite ; petit rayon : elle tourne, et l'on sait de quel côté.

04
Une personne détectée ne devient un obstacle que si elle est proche. Le modèle de profondeur estime cette distance à partir de la même image RGB, si bien que le moteur réagit à qui est près plutôt qu'à chaque personne visible.
Une piste produit bien plus d'informations qu'un humain ne peut en traiter en courant. Le moteur émet au plus une consigne et tait le reste, avec un délai propre à chaque priorité.
La priorité prime
Chaque niveau a son délai : une alerte n'est jamais bloquée par une consigne de direction récente.
Pas de harcèlement
La même phrase est tue pendant 3 secondes, aussi vraie soit-elle encore.
Le critique parle toujours
Une consigne critique ignore tous les délais et coupe l'audio en cours.
En float32, les modèles ne tenaient pas une cadence temps réel sur une Raspberry Pi. Ils sont donc compilés pour l'accélérateur Hailo : traduits dans sa représentation interne, profilés, quantifiés sur un jeu de calibration d'images réelles de piste, puis compilés en un exécutable chargé au démarrage.
Après compilation pour l’accélérateur, le prototype est 6× plus rapide et traite plus de 10 images par seconde.
Aucun jeu de données public ne montre une piste indonésienne à hauteur d'yeux de coureur. Nous avons donc constitué le nôtre à partir d'images prises à cette hauteur sur des pistes publiques, notamment au stade Patriot Candrabhaga, avec et sans personnes devant.
Chaque image est annotée deux fois : des boîtes pour les personnes, des polylignes pour les bords peints. Puis augmentée pour survivre au réel : une tête qui s'incline, une caméra qui tremble, un après-midi éblouissant ou gris.



Le prototype intégré fonctionne, mais ces points nécessitent encore du développement ou une validation.
Un seul modèle multitâche
L'accélérateur n'a pas de DRAM, donc changer de modèle à chaque image coûte cher. Fondre les trois en un seul modèle à plusieurs têtes est la solution.
Audio sans fil
L'appareil parle aujourd'hui dans un écouteur filaire. Le Bluetooth audio demande une seconde radio.
Mise à jour des modèles à distance
Aujourd'hui, un nouveau modèle suppose un accès physique à l'appareil.
Validation de terrain
Tout ce qui précède a été mesuré au banc et sur piste avec des testeurs voyants. Les essais encadrés avec des coureurs déficients visuels sont le vrai jalon. Ils n'ont pas encore eu lieu.