Aktionssegmentierung und dichte Beschreibungen
Die Plattform wandelt rohe egozentrische Aufnahmen und Robotervideos in strukturierte Daten um, die an benutzerdefinierte Aufgabenstrukturen angepasst sind. Sie identifiziert diskrete, zeitgestempelte Schritte, die vorgegebenen Verblisten und Aktionshierarchien zugeordnet werden können.
Für sprachkonditionierte Roboter-Policies generiert das System Beschreibungen in natürlicher Sprache, die Hand-Objekt-Interaktionen, räumliche Beziehungen und kontextuelle Szenendynamiken detailliert erfassen, ohne dass separate Transkriptions- oder Framing-Werkzeuge kombiniert werden müssen.
- Erkennung diskreter, mit Zeitstempeln versehener Aktionen aus egozentrischen Videos
- Unterstützung benutzerdefinierter Taxonomien für vorgegebene Verben und Aktionshierarchien
- Detaillierte natürlichsprachliche Beschreibungen von Hand-Objekt-Interaktionen und räumlichem Kontext
Qualitätsvalidierung und Compliance-Prüfung
Um minderwertige Aufnahmen von Modell-Pipelines fernzuhalten, bewertet die Lösung Kamerastabilität, Bildausschnitt, visuelle Verdeckungen und Aktionsklarheit mithilfe konfigurierbarer Qualitätsprompts.
Der Prüfprozess umfasst zudem automatisierte Compliance-Checks, die Minderjährige sowie personenbezogene Daten wie Gesichter, Nummernschilder, Dienstausweise und Dokumente vor der Datenauslieferung lokalisieren.
- Automatisierte Bewertung von Kamerastabilität, Bildausschnitt und Verdeckung
- Compliance-Prüfung vor dem Review auf Gesichter, Dokumente, Dienstausweise und Nummernschilder
- Erkennung von Minderjährigen zur Einhaltung nachgelagerter Datenschutzstandards