ObjekterkennungBeta

Gaze

Was ist wo, in jedem Bild.

Objekterkennung

Ein Facettenauge für Ihre Kamera.

Gaze erkennt und verfolgt Objekte in Video über das Sehsystem des Konnektoms, mit einem klassischen CNN-Co-Prozessor für Klassenlabels. Für Bewegung gebaut, findet es zuerst, was sich bewegt.

Bilder werden auf das hexagonale Photorezeptor-Raster umgerechnet und durchlaufen die optischen Loben wie in der Fliege. Die intrinsische Population kodiert Position und Bewegung; ein leichter CNN-Co-Prozessor benennt das Objekt. Zusammen ergibt das Box, Klasse und Geschwindigkeit je Objekt.

30 fps auf einem Laptop. Bewegtes zuerst.

Gaze läuft mit 30 fps auf Apple Silicon und erreicht 0,71 mAP auf COCO-motion, dem Teil der COCO-Videos, in dem sich Objekte bewegen. Statischer Hintergrund wird bewusst abgewertet.

Zielwert Mit „Zielwert“ markierte Zahlen sind Entwicklungsziele für das erste Release, keine Messungen.

30 fpsZielwertDurchsatzApple M-Serie, volles Konnektom
0.71ZielwertmAPCOCO-motion-Teilmenge
So ist es gebaut

Gleiches Gehirn, eigene Verdrahtung.

Eingabe-Adapter belegen afferente Regionen, Ausgabe-Adapter lesen efferente. Co-Prozessoren speisen über den Embedding-Port ein.

3D-Ansicht braucht WebGPU oder WebGL2.
Engine
  • FlyCore v0.1.0
  • Gewichte v0.1.0-beta
Eingabe-Adapter
  • frames (compound eye)
Ausgabe-Adapter
  • boxes, classes, velocities
Co-Prozessoren
  • CNN classifier
Python
import flycore

brain = flycore.load("flylabs/gaze")      # engine + weights + adapters
for frame in flycore.io.Camera():
    objects = brain(frame)
# objects -> [Object(box, cls, velocity, score), ...]
Anwendungsfälle

Was ist wo, in jedem Bild.

Roboter- und Drohnensicht

Erkennung, die sich ein Gehirn mit dem Controller teilt, damit Verfolgung und Steuerung eine Schleife sind.

Zählen im Handel und Verkehr

Zählen, was eine Linie passiert, auf dem Gerät, ohne Upload.

Grenzen
  • Beta: nur 80 COCO-Klassen; eigene Klassen brauchen ein Co-Prozessor-Fine-Tuning.
  • Bei statischen Szenen absichtlich schwach.