
Ein Transkribierer, der weiß, wann Sie aufgehört haben.
Dictate kombiniert einen kompakten Sprach-Co-Prozessor mit dem Konnektom. Der Co-Prozessor liefert Wörter; das Gehirn entscheidet Segmentierung, Sprecherwechsel und wann ein Kommando vollständig ist.
Transkription ist für klassische Modelle gelöst. Schlecht sind sie im Timing: wann aufhören zuzuhören, wann eine Pause ein Punkt ist. Dictate überlässt die Wörter dem Co-Prozessor und das Timing einem Gehirn, das seit hundert Millionen Jahren Sprecherwechsel beherrscht.
Endpunkterkennung dreimal näher am Menschen.
Dictate beendet ein Segment innerhalb von 180 ms der menschlichen Annotation, gegenüber 550 ms für eine feste Stille-Schwelle, bei einer Wortfehlerrate wie die des Co-Prozessors.
Zielwert Mit „Zielwert“ markierte Zahlen sind Entwicklungsziele für das erste Release, keine Messungen.
Gleiches Gehirn, eigene Verdrahtung.
Eingabe-Adapter belegen afferente Regionen, Ausgabe-Adapter lesen efferente. Co-Prozessoren speisen über den Embedding-Port ein.
- FlyCore v0.1.0
- Gewichte v0.1.0-beta
- audio (antennae)
- speech embedding
- segments (text, t0, t1)
- speech recogniser
import flycore
brain = flycore.load("flylabs/dictate") # engine + weights + adapters
for seg in brain.stream(flycore.io.Microphone()):
print(seg.text, seg.t0, seg.t1)
# "open the settings" 3.10 4.02Wörter, das Gehirn übernimmt das Timing.
Sprachbefehle für Geräte
Wissen, dass der Befehl fertig ist, ohne Wake-Word oder Taste.
Meeting-Notizen auf dem Gerät
Segmente, die dem echten Sprechen entsprechen.
- Beta: Co-Prozessor deckt 25 Sprachen ab; das Gehirn ist sprachunabhängig.
- Wortgenauigkeit ist die des Co-Prozessors, nicht des Gehirns.