
Der Co-Prozessor, der dem Gehirn sagt, wohin.
Intent macht aus einer kurzen Anweisung plus Bildschirm eine Ziel-Einbettung, auf die die Steuerungs-Gewichte reagieren können. Es ist die Brücke zwischen Sprache und Bewegung und kommt als Co-Prozessor für Cursor und Keys.
Ein kleines Vision-Language-Modell liest Anweisung und Bildschirm und gibt eine Ziel-Einbettung aus. Die Einbettung wird über den Ziel-Adapter in die afferente Population injiziert, und das Gehirn übernimmt von dort.
Findet den Button in 94 % der Fälle.
Auf ScreenSpot verortet Intent das benannte Element in 94 % der Desktop-Screenshots mit einem 380-MB-Co-Prozessor und übergibt das Ziel in einem Schritt an Cursor.
Zielwert Mit „Zielwert“ markierte Zahlen sind Entwicklungsziele für das erste Release, keine Messungen.
Gleiches Gehirn, eigene Verdrahtung.
Eingabe-Adapter belegen afferente Regionen, Ausgabe-Adapter lesen efferente. Co-Prozessoren speisen über den Embedding-Port ein.
- FlyCore v0.1.0
- Gewichte v0.1.0-beta
- instruction
- screen
- target embedding
- vision-language model
import flycore
brain = flycore.load("flylabs/intent") # engine + weights + adapters
cursor = flycore.load("flylabs/cursor", coprocessors=[brain])
cursor.do("click Save")
# target grounded by Intent, motion by CursorVon „klicke Speichern“ zu einem Ziel.
UI-Automatisierung in natürlicher Sprache
„Als PDF exportieren“ wird zu einer Folge von Cursor- und Keys-Aktionen.
- Beta: englische Anweisungen.
- Braucht Cursor oder Keys zum Handeln; Intent allein erzeugt nur Ziele.