RunSight
ES

Tecnología

Una cámara, y todo lo que debe ocurrir antes de que pueda hablar.

Cómo un fotograma se vuelve geometría, la geometría una decisión y la decisión una frase corta, todo en un dispositivo a tu espalda y sin internet.

La cámara, los tres modelos, la geometría y la selección de indicaciones se ejecutan en el dispositivo. No se necesita internet.

Una cámara. Tres modelos en el dispositivo.

Una cámara USB a la altura de los ojos envía fotogramas a un acelerador Hailo-8. Tres modelos compilados corren en cada fotograma que el dispositivo conserva: uno segmenta las líneas pintadas del carril, uno detecta a las personas por delante y uno estima la profundidad a partir del mismo fotograma. No hay sensor de profundidad, ni LiDAR, ni una segunda cámara. La profundidad sale de la única cámara RGB, lo que mantiene el dispositivo asequible.

Los fotogramas se tratan con la regla de que gana el más reciente. Si la inferencia se retrasa, los fotogramas viejos se descartan en vez de encolarse: mejor callar que guiarte desde el pasado.

Salida de la segmentación del carril, con los carriles detectados en azul

U-Net

En el prototipo

ResNet-18 backbone

Segmenta las líneas pintadas para que el dispositivo sepa por dónde va el carril y dónde estás dentro de él.

84.23% IoUIoU, conjunto de validación

Salida de la detección de personas, con un recuadro alrededor de un corredor

YOLOv8n

En el prototipo

Nano detector

Encuentra a las personas en la pista delante: el obstáculo que de verdad importa en un carril compartido.

88.24% IoUIoU, conjunto de validación

Un mapa de profundidad de la pista, con los objetos cercanos en colores cálidos

Sc-Depth V3

En el prototipo

Monocular RGB

Estima a qué distancia está una persona detectada a partir de un solo fotograma RGB, para que el motor de guía sepa si un obstáculo está lo bastante cerca como para importar.

Self-supervisedprofundidad monocular, en el dispositivo

Resultados de segmentación del carril: imagen de entrada, predicción y verdad de referencia
Segmentación del carril: entrada, predicción y verdad de referencia anotada a mano.
Resultados de detección de personas: predicción frente a verdad de referencia
Detección de personas: predicción (rojo) frente a verdad de referencia (verde).

De los píxeles a una decisión.

Una máscara y unos recuadros no son una guía. Tienen que volverse geometría: por dónde va el carril, dónde estás dentro de él, cuánto se curva y si la persona de delante está lo bastante cerca como para importar.

Líneas del carril detectadas por el modelo, dibujadas en amarillo sobre la pista

01

Ajustar las líneas

Se extraen los contornos de la máscara y cada línea se ajusta con una curva cuadrática, de modo que una línea cortada por una persona o una sombra se interpola de nuevo como un borde continuo.

La región actual del corredor resaltada en verde entre las líneas ajustadas

02

Dividir la pista en regiones

Las líneas ajustadas dividen la pista en cinco regiones: extrema izquierda, izquierda, centro, derecha y extrema derecha. Después sitúan al corredor en una de ellas. De ahí sale la indicación de dirección.

Círculos de curvatura ajustados a las líneas del carril

03

Medir la curva

El radio de curvatura se calcula desde los puntos centrales de las líneas ajustadas. Un radio grande significa recta; uno pequeño, que la pista gira, y hacia dónde.

Una persona detectada delante con un valor de profundidad estimado

04

Juzgar a la persona de delante

Una persona detectada solo se convierte en obstáculo si está cerca. El modelo de profundidad estima esa distancia a partir del mismo fotograma RGB, de modo que el motor reacciona ante quien está cerca y no ante cada persona a la vista.

De la escena a una indicación hablada.

Una pista produce mucha más información de la que una persona puede atender corriendo. El motor emite como mucho una instrucción y silencia el resto, con una espera distinta por prioridad.

FraseCuándoPrioridadEspera
Move leftTe has desviado a la derecha del carril; la indicación te devuelve al centro.Dirección1.5s
Move rightTe has desviado a la izquierda del carril; la indicación te devuelve al centro.Dirección1.5s
Caution, person aheadHay alguien delante: lo bastante cerca para importar, aún no un peligro.Aviso0.8s
Stop, person aheadHay alguien delante y está cerca. La indicación interrumpe todo lo demás.CríticaNinguna
  • La prioridad manda

    Cada nivel tiene su propia espera, así un aviso nunca queda bloqueado por una indicación de dirección reciente.

  • Sin insistir

    La misma frase queda silenciada 3 segundos, por muy cierta que siga siendo.

  • Lo crítico siempre habla

    Una indicación crítica salta toda espera e interrumpe el audio que ya suena.

Hacer que los modelos quepan en el presupuesto de un fotograma.

En float32 los modelos no aguantaban una tasa de fotogramas en tiempo real en una Raspberry Pi. Por eso se compilan para el acelerador Hailo: traducidos a su representación interna, perfilados, cuantizados contra un set de calibración de fotogramas reales de pista y compilados en un ejecutable que el runtime carga al arrancar.

Después de compilar para el acelerador, el prototipo es 6× más rápido y procesa más de 10 fotogramas por segundo.

Los datos vienen de pistas indonesias.

Ningún conjunto público muestra una pista indonesia a la altura de los ojos de un corredor, así que lo creamos con imágenes tomadas a esa altura en pistas públicas, incluido el estadio Patriot Candrabhaga, con y sin gente delante.

Cada imagen se anota dos veces: recuadros para las personas y polilíneas para los bordes pintados. Después se aumenta para sobrevivir a la realidad: una cabeza que se inclina, una cámara que tiembla y una tarde que deslumbra o está gris.

Anotación de segmentación de líneas del carril en Label Studio
Anotación del carril: los bordes pintados, trazados a mano.
Anotación con recuadro de una persona en la pista en Label Studio
Anotación de personas: un recuadro por corredor delante.
Las cinco técnicas de aumento aplicadas por separado a una imagen de origen
Cada aumento, aplicado por separado a un mismo fotograma.

Estado del prototipo y próximas pruebas.

El prototipo integrado funciona, pero estos puntos aún necesitan desarrollo o validación.

  • Un solo modelo multitarea

    El acelerador no tiene DRAM, así que cambiar de modelo en cada fotograma es costoso. Fundir los tres en un solo modelo con varias cabezas es la salida.

  • Audio inalámbrico

    Hoy el dispositivo habla por un auricular con cable. El audio Bluetooth necesita una segunda radio junto a la del móvil.

  • Actualización de modelos por aire

    Ahora mismo, un modelo nuevo significa acceso físico al dispositivo.

  • Validación de campo

    Todo lo anterior se midió en el banco y en pista con probadores videntes. Las pruebas guiadas con corredores con discapacidad visual son la prueba real, y aún no se han hecho.