Audio-Transkription und -Annotation indischer Sprachen: Fallstudie zu Konversations-KI

Sie boten hochwertige Audio-Transkriptions- und Annotationsdienste an, um ihre KI-gestützte Sprachverarbeitungs-Engine zu trainieren.

Mehrsprachige Konversations-KI

Projektübersicht: Entwicklung einer mehrsprachigen Sprachausgabemaschine für indische Sprachen 

Der Kunde ist Indiens führendes KI-Produktlabor mit Marktpräsenz in den USA, Indien, Kanada und weiteren Ländern. Seine Vision ist es, das menschliche Potenzial durch Technologie zu erweitern. Er verfügt über mehr als zehn Jahre Erfahrung in Spitzenforschung im Bereich NLP, insbesondere in den Bereichen Künstliche Intelligenz, Maschinelles Lernen, Analytik, Visualisierung und verwandten Technologien.

Mit ihren KI-Produkten ICOG und Autovox erweitern sie die Grenzen der Mensch-Maschine-Interaktion. ICOG ist ein KI-basierter, personalisierter, intelligenter virtueller Lernassistent für die Weiterbildung und Transformation von Mitarbeitern, während Autovox eine KI-gestützte Spracherkennungssoftware ist.
Verarbeitungs-Engine für indische Sprachen.

Konversations-KI

Wichtigste Ergebnisse: 1,200 Stunden annotiert in 6 Sprachen

Audio transkribiert und kommentiert

1,200 Hrs

Anzahl der
Sprachen

6 (200 Std. x 6 Sprachen)

Transkription und Kommentierung der Sprachen

Indisches Englisch, Hindi, Tamil, Telugu, Kannada, Malayalam

Projekt
Geschichte

10 Wochen

Die Herausforderung: Suche nach Fachlinguisten für die Audioannotation indischer Sprachen

Der Mangel an qualifizierten Linguisten und Experten für die Datenannotation sowie die lange Markteinführungszeit stellten bisher ein Hindernis für den Fortschritt und die Verbreitung von dialogorientierter KI dar. Die Suche nach Linguisten, die Transkription und Annotation großer Datenmengen in der erforderlichen Qualität – ausreichend für die Entwicklung von KI-Funktionen – war stets ein zeitaufwändiger und kostspieliger Prozess, der Fachkräfte aus verschiedenen Bereichen erforderte. Trotz eines internen Teams von Annotatoren traten Probleme mit der termingerechten Lieferung und der Qualität der Annotationen auf.

Die entscheidenden Anforderungen des Kunden waren:

  1. Zugang zu qualifizierten Linguisten: Mangelnder Zugang zu Fachlinguisten für indische Sprachen wie indisches Englisch, Hindi, Tamil, Telugu, Kannada und Malayalam
  2. Audio-Transkription & Annotation: Richtlinien für komplexe Audioannotationen und -transkriptionen mit einer Mindestgenauigkeit von 95 %
  3. Datenlieferung: Die Transkriptdateien werden innerhalb von 10 Wochen im JSON-Format geliefert.

Die Lösung: Audio-Transkription und -Annotation durch erfahrene Linguisten

Dank unseres profunden Verständnisses von dialogorientierter KI konnten wir dem Kunden helfen, die bereitgestellten Datensätze zu transkribieren und zu annotieren, indem wir ein Team von erfahrenen Linguisten und Annotatoren einsetzten, um ihre KI-gestützte Sprachverarbeitungs-Engine für indische Sprachen zu trainieren.

Nach der Evaluierung zahlreicher Anbieter (darunter auch einige Branchengrößen) entschied sich der Kunde für Shaip aufgrund unserer Expertise in der Durchführung großer dialogorientierter KI-Projekte innerhalb strenger Zeitvorgaben und der von uns angebotenen Qualität zu wettbewerbsfähigen Preisen.

  1. Richtlinien für Audiotranskription und -annotation befolgt
    • Audioart annotiert als Sprache & Nicht-Sprache
    • Wenn der Audiotyp des ausgewählten Segments als Sprache gekennzeichnet ist, muss der Sprachtyp ausgewählt werden, z. B. saubere Sprache, Sprache + Musik, Sprache + Rauschen, unverständliche Sprache.
    • Der ausgewählte Sprachabschnitt sollte der vom Sprecher gesprochenen Sprache zugeordnet werden.
    • Der Bearbeiter sollte die Regionen mit Sprecherkennzeichnungen versehen. Verschiedene Sprecher sollten
      Mit unterschiedlichen Sprecherkennzeichnungen versehen.
    • Der Kommentator muss das Geschlecht des Sprechers auswählen, d. h. männlich oder weiblich.
    • Der Text sollte so geschrieben werden, wie er im Audio gesprochen wird, und grammatikalisch korrekt sein.
    • Wenn der ausgewählte Audiotyp kein Sprachsignal ist, sollte ihm eine der folgenden Kategorien zugewiesen werden: keine Sprache, Musik, Schmatzen, Atem, Husten, Lachen, Klingeln, DTMF, Gebrabbel, Fahrzeuggeräusche und intermittierendes Vordergrundgeräusch.
    • Alle Segmente der Audiodatei müssen mit Tags versehen werden, erst dann können sie in das System hochgeladen werden.
  2. Datenlieferung
    Alle Transkriptdateien wurden innerhalb von 10 Wochen im JSON-Format gemäß den vorgegebenen Metadatenanforderungen geliefert.

Das Ergebnis: Eine produktionsreife, mehrsprachige Konversations-KI-Engine

Die qualitativ hochwertigen, von Expertenlinguisten annotierten Audiodaten ermöglichten es dem Kunden, seine KI-gestützte Sprachverarbeitungs-Engine in der vorgegebenen Zeit präzise in 6 indischen Sprachen zu trainieren, nämlich indischem Englisch, Hindi, Tamil, Telugu, Kannada und Malayalam.

Mithilfe erstklassiger Trainingsdatensätze kann der Kunde ein intelligentes und robustes Sprachsystem mit Mehrsprachigkeit anbieten, das End-to-End- (E2E) und Hybridmodelle zur Lösung realer Probleme nutzt. Kurz gesagt: Es geht um die Entwicklung einer Konversations-KI (wie Alexa oder Siri), die speziell auf die Bedürfnisse indischer Konsumenten zugeschnitten ist.

Zitatsymbol

Wir waren positiv überrascht von Shaips effizientem Workflow-Management, der schnellen Bearbeitungszeit, ihrer Erfahrung im Bereich dialogorientierter KI und ihrem Netzwerk an Sprachexperten. Darüber hinaus ist ihr Preis-Leistungs-Verhältnis unübertroffen.

★ ★ ★ ★ ★
Zitatsymbol