Anmerkung zu Schlüsselpunkten des menschlichen Körpers
Shaip annotierte 150,000 Frames von Bild- und Videodaten mit einem 36-Keypoint-Ganzkörperschema, das Gesichtsmerkmale (Kopf, Augen, Ohren, Nase, Kinn) mit Skelettgelenken (Schultern, Ellbogen, Handgelenke, Hüften, Knie, Knöchel) kombiniert – um die Schätzung der Körperhaltung, die Bewegungsanalyse, das Fitness-Tracking und die KI für Bewegungsanalysen im Gesundheitswesen zu ermöglichen.
Projektübersicht
Da die Pose-Schätzung und die KI für menschliche Bewegungen zunehmend in den Produktiveinsatz gehen, benötigte der Kunde ein skalierbares Annotationsframework, um 150,000 Frames von Bild- und Videodaten mit anatomisch präziser Ganzkörper-Keypoint-Abdeckung unter verschiedensten realen Bedingungen zu kennzeichnen.
Shaip entwickelte die durchgängige Annotationspipeline, die die Platzierung von Schlüsselpunkten, die Handhabung von Posen aus verschiedenen Winkeln, das Okklusionsmanagement und die strukturierte Qualitätssicherung umfasst – und unterstützt die Bereitstellung eines 36-Punkte-Körperschemas sowie die Produktion von modellfertigen Datensätzen mit einem gleichbleibenden täglichen Durchsatz.
Schlüsselstatus
Frames mit Anmerkungen
150,000
Kernpunkte / Hauptteil
36
Täglicher Durchsatz
30-Frames
Plattform
CVAT
Challenges
- Skalierung von kontrollierten Probenworkflows zu 150,000-Frames Annotation des Ganzkörperskeletts
- Aufrechterhaltung anatomische Präzision über verschiedene Posen, Blickwinkel und Lichtverhältnisse hinweg
- Handhabung teilweise Okklusion und sich überlappende Themen, ohne die Genauigkeit der Schlüsselpunkte zu beeinträchtigen
- Koordination Gesichtsmerkmale + Körperskelett Platzierung auf einem einzelnen 36-Punkte-Schema
- A aufrechterhalten 30 Bilder pro Tag pro Annotator Durchsatz-Benchmark im gesamten Team
Lösung
Annotationsstrategie
Shaip entwickelte ein 36-Punkte-Körperschema, das die gesamte Anatomie abdeckt – Gesichtspunkte (Kopf, Augen, Ohren, Nase, Kinn) kombiniert mit Skelettgelenken an Schultern, Armen, Rumpf, Hüften und Beinen. Die CVAT-Plattform wurde mit diesem Schema konfiguriert und im gesamten Team eingeführt, um eine einheitliche Beschriftung zu gewährleisten.
Umgang mit Posen und Diversität
Der Datensatz umfasste bewusst eine Vielzahl von Personen in unterschiedlichen Posen, Blickwinkeln, Lichtverhältnissen und Kleidungsarten. Die Annotatoren folgten posenspezifischen Richtlinien, um stehende, sitzende, hockende, liegende und dynamische Bewegungsposen mit der gleichen Präzision bei der Schlüsselpunkterfassung zu bearbeiten.
Okklusions- und Grenzfallregeln
Für den Umgang mit teilweisen Verdeckungen – wie z. B. Schlüsselpunkten hinter Kleidung, Körperteilen, die von anderen Gliedmaßen verdeckt werden, und Personen, die sich teilweise außerhalb des Bildausschnitts befinden – galten strenge Regeln. Verdeckte Landmarken wurden mit Sichtbarkeitsmarkierungen versehen, anstatt sie zu approximieren, um die Datenintegrität für nachfolgende Modelle zur Pose-Schätzung zu gewährleisten.
Durchsatz- und Produktivitätsbenchmark
Das Team hielt während einer 8.5-Stunden-Schicht einen Richtwert von 30 freigegebenen, annotierten Bildern pro Annotator und Tag ein. Dieser Richtwert wurde anhand von Genauigkeitsvorgaben kalibriert, um sicherzustellen, dass der Durchsatz die Qualität nicht beeinträchtigte.
Workflow zur Qualitätssicherung
Jedes annotierte Bild durchlief eine strukturierte Qualitätssicherung, die die Genauigkeit der Keypoint-Platzierung, die Korrektheit der Sichtbarkeitsmarkierungen und die Übereinstimmung mit dem 36-Punkte-Schema umfasste. Abgelehnte Bilder wurden zur Korrektur mit Feedback der Annotatoren zurückgesendet, um eine kontinuierliche Verbesserung zu gewährleisten.
Projektumfang
| Datensatztyp | Volumen | Schlüsselpunkte | Plattform | Durchsatz | Geschichte |
|---|---|---|---|---|---|
| Menschliches Körperskelett + Schlüsselpunktannotation | 150,000-Frames | 36 pro menschlicher Figur | CVAT | 30 Bilder/Tag/Annotator | Mehrmonatig |
Ergebnisse:
- Gegründet a skalierbares 36-Schlüsselpunkt-Annotationsframework bereit für das Produktionstraining zur Pose-Schätzung
- Standardisiert Platzierung anatomischer Landmarken über Gesichts- und Skelettregionen hinweg
- Leicht Annotatordurchsatz von 30 Bildern pro Tag ohne Kompromisse bei der Präzision
- Geliefert ein vielfältiger Datensatz mit mehreren Bedingungen von Posen über Beleuchtung und Blickwinkel bis hin zu Kleidungsarten
- Die Client-Einstellungen wurden aktiviert. Körperhaltungsschätzung, Bewegungsanalyse, Fitness-Tracking und KI für Bewegungsanalyse im Gesundheitswesen Fahrplan
Insgesamt trug Shaip dazu bei, eine Anforderung an die Keypoint-Annotation von 150,000 Einzelbildern in eine strukturierte, produktionsreife Pipeline umzuwandeln – eine Pipeline, die in der Lage ist, KI für die menschliche Körperhaltung, Fitness-Tracking, Bewegungsdiagnostik und Anwendungen im Bereich der Bewegungsanalyse im Gesundheitswesen mit gleichbleibender Präzision und in großem Umfang zu unterstützen.
Shaip lieferte uns die Grundlage für die Keypoint-Annotation mit der Präzision, die unsere Pose-Schätzmodelle benötigten. Die Ausführung des 36-Punkte-Schemas, die Behandlung von Verdeckungen und der konstant hohe tägliche Durchsatz führten direkt zu einer besseren Modellleistung.
— Direktor, Computer Vision Engineering