
U-Net
En el prototipoResNet-18 backbone
Segmenta las líneas pintadas para que el dispositivo sepa por dónde va el carril y dónde estás dentro de él.
84.23% IoUIoU, conjunto de validación
RunSightTecnología
Cómo un fotograma se vuelve geometría, la geometría una decisión y la decisión una frase corta, todo en un dispositivo a tu espalda y sin internet.
Cámara RGB USB
Acelerador Hailo-8
Percepción con tres modelos

U-Net

YOLOv8n

Sc-Depth V3
Geometría del carril y los obstáculos
Motor de indicaciones
Guía por voz
Una cámara USB a la altura de los ojos envía fotogramas a un acelerador Hailo-8. Tres modelos compilados corren en cada fotograma que el dispositivo conserva: uno segmenta las líneas pintadas del carril, uno detecta a las personas por delante y uno estima la profundidad a partir del mismo fotograma. No hay sensor de profundidad, ni LiDAR, ni una segunda cámara. La profundidad sale de la única cámara RGB, lo que mantiene el dispositivo asequible.
Los fotogramas se tratan con la regla de que gana el más reciente. Si la inferencia se retrasa, los fotogramas viejos se descartan en vez de encolarse: mejor callar que guiarte desde el pasado.

ResNet-18 backbone
Segmenta las líneas pintadas para que el dispositivo sepa por dónde va el carril y dónde estás dentro de él.
84.23% IoUIoU, conjunto de validación

Nano detector
Encuentra a las personas en la pista delante: el obstáculo que de verdad importa en un carril compartido.
88.24% IoUIoU, conjunto de validación

Monocular RGB
Estima a qué distancia está una persona detectada a partir de un solo fotograma RGB, para que el motor de guía sepa si un obstáculo está lo bastante cerca como para importar.
Self-supervisedprofundidad monocular, en el dispositivo


Una máscara y unos recuadros no son una guía. Tienen que volverse geometría: por dónde va el carril, dónde estás dentro de él, cuánto se curva y si la persona de delante está lo bastante cerca como para importar.

01
Se extraen los contornos de la máscara y cada línea se ajusta con una curva cuadrática, de modo que una línea cortada por una persona o una sombra se interpola de nuevo como un borde continuo.

02
Las líneas ajustadas dividen la pista en cinco regiones: extrema izquierda, izquierda, centro, derecha y extrema derecha. Después sitúan al corredor en una de ellas. De ahí sale la indicación de dirección.

03
El radio de curvatura se calcula desde los puntos centrales de las líneas ajustadas. Un radio grande significa recta; uno pequeño, que la pista gira, y hacia dónde.

04
Una persona detectada solo se convierte en obstáculo si está cerca. El modelo de profundidad estima esa distancia a partir del mismo fotograma RGB, de modo que el motor reacciona ante quien está cerca y no ante cada persona a la vista.
Una pista produce mucha más información de la que una persona puede atender corriendo. El motor emite como mucho una instrucción y silencia el resto, con una espera distinta por prioridad.
La prioridad manda
Cada nivel tiene su propia espera, así un aviso nunca queda bloqueado por una indicación de dirección reciente.
Sin insistir
La misma frase queda silenciada 3 segundos, por muy cierta que siga siendo.
Lo crítico siempre habla
Una indicación crítica salta toda espera e interrumpe el audio que ya suena.
En float32 los modelos no aguantaban una tasa de fotogramas en tiempo real en una Raspberry Pi. Por eso se compilan para el acelerador Hailo: traducidos a su representación interna, perfilados, cuantizados contra un set de calibración de fotogramas reales de pista y compilados en un ejecutable que el runtime carga al arrancar.
Después de compilar para el acelerador, el prototipo es 6× más rápido y procesa más de 10 fotogramas por segundo.
Ningún conjunto público muestra una pista indonesia a la altura de los ojos de un corredor, así que lo creamos con imágenes tomadas a esa altura en pistas públicas, incluido el estadio Patriot Candrabhaga, con y sin gente delante.
Cada imagen se anota dos veces: recuadros para las personas y polilíneas para los bordes pintados. Después se aumenta para sobrevivir a la realidad: una cabeza que se inclina, una cámara que tiembla y una tarde que deslumbra o está gris.



El prototipo integrado funciona, pero estos puntos aún necesitan desarrollo o validación.
Un solo modelo multitarea
El acelerador no tiene DRAM, así que cambiar de modelo en cada fotograma es costoso. Fundir los tres en un solo modelo con varias cabezas es la salida.
Audio inalámbrico
Hoy el dispositivo habla por un auricular con cable. El audio Bluetooth necesita una segunda radio junto a la del móvil.
Actualización de modelos por aire
Ahora mismo, un modelo nuevo significa acceso físico al dispositivo.
Validación de campo
Todo lo anterior se midió en el banco y en pista con probadores videntes. Las pruebas guiadas con corredores con discapacidad visual son la prueba real, y aún no se han hecho.