Medizinischer Datenkatalog für KI im Gesundheitswesen

Standardmäßige Gesundheits-/medizinische Datensätze, um Ihr KI-Projekt im Gesundheitswesen in Gang zu bringen

Medizinischer Datenkatalog

Medizinische und Gesundheitswesen-Datensätze für maschinelles Lernen

Was beinhaltet der Shaip Medical Data Catalog?

Der Shaip Medical Data Catalog ist eine HIPAA-konforme, sofort verfügbare Bibliothek mit anonymisierten Trainingsdaten aus dem Gesundheitswesen, die 31 medizinische Fachrichtungen abdeckt. Sie umfasst 257,977 Stunden an ärztlichen Diktaten, transkribierten Patientenakten, elektronischen Patientenakten und multimodalen Datensätzen. Jeder Datensatz ist für das kommerzielle KI-Training lizenziert und wird mit Safe-Harbor- oder Experten-Determination-Anonymisierung ausgeliefert.

Arztdiktat-Audiodaten

Unser anonymisierter Datensatz für das Gesundheitswesen umfasst Audiodateien aus 31 Fachgebieten, die von Ärzten diktiert wurden und den klinischen Zustand und Behandlungsplan der Patienten auf der Grundlage von Arzt-Patienten-Begegnungen im klinischen Umfeld beschreiben.

Standardmäßige Audiodateien für Arztdiktate:

  • 257,977 Stunden realer Sprachdatensätze von Ärzten aus 31 Fachgebieten zum Trainieren von Sprachmodellen im Gesundheitswesen
  • Diktataudio, das von verschiedenen Geräten wie Telefondiktat (54.3 %), Digitalrecorder (24.9 %), Sprachmikrofon (5.4 %), Smartphone (2.7 %) und Unbekannt (12.7 %) aufgenommen wurde
  • PII redigierte Audiodateien und Transkripte, die den Safe-Harbor-Richtlinien in Übereinstimmung mit HIPAA entsprechen
Audiodaten zum Diktat eines Arztes

Transkribierte Krankenakten

Transkribierte Krankenakten umfassen die Transkription von Arzt-Patienten-Gesprächen, die Transkription von Arztberichten und die medizinische Beurteilung. Sie helfen dabei, die Krankengeschichte des Patienten für zukünftige Besuche abzubilden und dienen den Ärzten als Orientierungshilfe. Sie helfen, den aktuellen Zustand des Patienten zu beurteilen und eine geeignete Behandlung vorzuschlagen.

Transkribierte Krankenakten von der Stange:

  • Transkription von 257,977 Stunden realer Arztdiktate aus 31 Fachgebieten zum Trainieren von Sprachmodellen im Gesundheitswesen
  • Transkribierte medizinische Aufzeichnungen aus verschiedenen Arbeitsarten wie Operationsbericht, Entlassungszusammenfassung, Konsultationsnotiz, Aufnahmenotiz, ED-Notiz, Kliniknotiz, Radiologiebericht usw.
  • PII redigierte Audiodateien und Transkripte, die den Safe-Harbor-Richtlinien in Übereinstimmung mit HIPAA entsprechen
Transkribierte Krankenakten

Elektronische Patientenakte (EHR)

Elektronische Gesundheitsakten oder EHR sind Krankenakten, die die Krankengeschichte, Diagnosen, Rezepte, Behandlungspläne, Impf- oder Immunisierungsdaten, Allergien, radiologische Bilder (CT-Scan, MRT, Röntgen) sowie Labortests und mehr enthalten.

Elektronische Patientenakten (EHR) von der Stange:

  • 5.1 Millionen Aufzeichnungen und Audiodateien von Ärzten in 31 Fachgebieten
  • Echte medizinische Aufzeichnungen nach Goldstandard zum Trainieren von klinischem NLP und anderen Dokumenten-KI-Modellen
  • Metadateninformationen wie MRN (anonymisiert), Aufnahmedatum, Entlassungsdatum, Aufenthaltsdauer in Tagen, Geschlecht, Patientenklasse, Kostenträger, Finanzklasse, Bundesland, Entlassungsdisposition, Alter, DRG, DRG-Beschreibung, $ Erstattung, AMLOS, GMLOS, Risiko von Sterblichkeit, Schweregrad der Erkrankung, Zackenbarsch, Postleitzahl des Krankenhauses usw.
  • Krankenakten aus verschiedenen US-Bundesstaaten und Regionen – Nordosten (46 %), Süden (9 %), Mittlerer Westen (3 %), Westen (28 %), Andere (14 %)
  • Krankenakten, die zu allen abgedeckten Patientenklassen gehören – stationär, ambulant (klinisch, Reha, wiederkehrende, chirurgische Tagespflege), Notfall.
Elektronische Gesundheitsakte (ehr)
  • Krankenakten aller Altersgruppen der Patienten < 10 Jahre (7.9 %), 11–20 Jahre (5.7 %), 21–30 Jahre (10.9 %), 31–40 Jahre (11.7 %), 41–50 Jahre (10.4 % ), 51–60 Jahre (13.8 %), 61–70 Jahre (16.1 %), 71–80 Jahre (13.3 %), 81–90 Jahre (7.8 %), 90+ Jahre (2.4 %)
  • Geschlechterverhältnis der Patienten von 46 % (männlich) und 54 % (weiblich)
  • PII redigierte Dokumente, die den Safe-Harbor-Richtlinien in Übereinstimmung mit HIPAA entsprechen

Fünf Gründe, warum Käufer Lizenz Shaip anstatt es zusammenzunähen.

Der Shaip Medical Data Catalog existiert, weil Die meisten KI-Teams im Gesundheitswesen verlieren neun bis zwölf Monate. Die Beschaffung konformer Trainingsdaten ist erforderlich, bevor ein einziges Modell trainiert wird. Folgendes ändert sich, wenn diese Monate zurückgegeben werden.

01

Katalogumfang, den die meisten Teams nicht erreichen können.

Der Shaip-Katalog umfasst 257,977 Stunden von ärztlichen Diktaten, Transkriptionen von 31 medizinische Fachgebieteund elektronische Patientenakten, die alle Altersgruppen abdecken – ein Datenvolumen, das es Käufern ermöglicht, Modelle trainieren und evaluieren, ohne ein Dutzend offener Datensätze zusammenzufügen.

02

Die Einhaltung der Vorschriften ist eine Ausgangsbedingung, keine Eigenschaft.

Jeder medizinische Datensatz von Shaip wird ausgeliefert mit HIPAA Safe Harbor: Standardmäßige AnonymisierungExpertengutachten auf Anfrage, DSGVO-konforme Abwicklung und BAA-Vorbereitung für betroffene Unternehmen. Käufer müssen die Compliance nicht nachträglich anpassen.

HIPAA Safe Harbor Expertenfeststellung DSGVO-konform BAA-Ready
03

Fachkräfte mit medizinischer Ausbildung, keine gewöhnlichen Crowdworker.

Annotation, Transkription und Qualitätssicherung des medizinischen Katalogs von Shaip werden durchgeführt von im Gesundheitswesen ausgebildete SpezialistenDer Shaip-Workflow umfasst eine mehrstufige Qualitätssicherung und eine Validierung mit menschlicher Beteiligung, die auf klinische Genauigkeitsstandards kalibriert ist.

04

Heute sofort verfügbar, auf Anfrage individuell anpassbar.

Käufer können bestehende Shaip-Datensätze sofort lizenzieren oder eine kundenspezifische Datenerhebung in Auftrag geben, die auf bestimmte demografische Merkmale, geografische Regionen, Sprachen und Modalitäten zugeschnitten ist. ohne den Anbieter zu wechseln oder die Compliance-Prüfung erneut durchzuführen.

05

Verfügbar dort, wo Datenteams bereits arbeiten.

Die anonymisierten Datensätze von Shaip aus elektronischen Patientenakten und ärztlichen Diktaten sind verfügbar auf der Databricks-MarktplatzDie Lieferung erfolgt in Formaten, die Daten- und ML-Teams bereits verwenden – JSON, CSV, WAV. Beispieldatensätze sind vor einer endgültigen Zusage verfügbar.

JSON CSV WAV FHIR

Sicherheit & Compliance

Datenschutz
HIPAA
ISO 9001:2015
SOC 2 Typ II
ISO 27001
Shaip kontaktieren Sie uns

Können Sie nicht finden, wonach Sie suchen?

Über alle Datentypen hinweg werden neue medizinische Standarddatensätze gesammelt 

Kontaktieren Sie uns jetzt, um Ihre Sorgen um die Erfassung von Gesundheitstrainingsdaten loszuwerden

  • Dieses Feld ist für die Zwecke der Validierung und sollten unverändert bleiben.
  • Mit der Registrierung stimme ich Shaip zu Datenschutzbestimmungen und Nutzungsbedingungen und erteile meine Zustimmung zum Erhalt von B2B-Marketingkommunikation von Shaip.

Medizinische Datensätze sind Gesundheitsdaten, die zum Trainieren, Evaluieren und Verbessern von KI/ML-Modellen verwendet werden. Sie können ärztliche Diktate, transkribierte Krankenakten, elektronische Patientenakten, synthetische Arzt-Patienten-Dialoge und multimodale Gesundheitsdatensätze umfassen, die relevanten Text, Sprache und strukturierte klinische Daten kombinieren.

Der Shaip Medical Data Catalog umfasst ärztliche Diktate, transkribierte Patientenakten, elektronische Gesundheitsakten, synthetische Arzt-Patienten-Dialoge und multimodale Datensätze, die Text, Sprache und strukturierte klinische Daten auf Patienten- oder Behandlungsebene verknüpfen. Er beinhaltet 257,977 Stunden ärztliche Diktate aus 31 medizinischen Fachrichtungen und steht für kommerzielles KI-Training zur Verfügung.

Ja. Die medizinischen Datensätze von Shaip werden standardmäßig gemäß HIPAA Safe Harbor anonymisiert, wodurch die 18 in der HIPAA-Datenschutzregel festgelegten Kategorien von Identifikatoren entfernt werden. Eine Anonymisierung durch Experten ist ebenfalls möglich, wenn eine statistische Zertifizierung erforderlich ist. Shaip erfüllt die Anforderungen der Business Access Agreement (BAA) für betroffene Einrichtungen.

Ja. Die medizinischen Datensätze von Shaip können je nach Projektumfang, geografischem Standort, Datentyp und vertraglichen Anforderungen so aufbereitet werden, dass sie HIPAA, DSGVO und andere anwendbare Anforderungen an Gesundheitsdaten erfüllen.

Beide Optionen stehen zur Verfügung. Shaip bietet über den Shaip Medical Data Catalog sofort verfügbare Datensätze aus dem Gesundheitswesen für das Training kommerzieller KI-Systeme an. Benötigt ein Projekt eine bestimmte Sprache, demografische Merkmale, Fachgebiete, Modalitäten oder klinische Umgebungen, kann Shaip auch individuelle medizinische Datenerhebungen unter Einhaltung derselben Compliance-Standards durchführen.

Ja. Shaip kann medizinische Datensätze nach Fachgebiet, Patientenalter, Geschlecht, Region, Sprache, Modalität, klinischem Umfeld, Format, Umfang und Projektanforderungen anpassen. Die kundenspezifischen Datensätze werden in einer Leistungsbeschreibung festgelegt und entsprechen den geltenden Anonymisierungs- und Compliance-Standards.

Ja. Shaip stellt repräsentative Beispieldatensätze unter Geheimhaltungsvereinbarung zur Verfügung, damit KI-Teams Format, Qualität, demografische Abdeckung und Modellgüte vor der Lizenzierung bewerten können. Der Zugriff auf Beispieldatensätze ist in der Regel der erste Schritt vor dem Abschluss einer Standardlizenz oder der Beauftragung einer kundenspezifischen Datensammlung.

Shaip liefert medizinische Datensätze in KI-fähigen Formaten, darunter JSON, CSV und FHIR für strukturierte Datensätze; WAV-Dateien mit zugehörigen Transkripten für Audiodaten; und Transkriptdateien für Sprach- und Datenerfassungsdateien. Multimodale Datensätze können Manifestdateien enthalten, die Text, Audio und strukturierte klinische Datensätze verknüpfen.

Shaip gewährleistet die Qualität medizinischer Datensätze durch Expertenprüfung, Annotation durch Fachspezialisten, Validierungsworkflows und strukturierte Qualitätssicherungsprüfungen. Diese Prozesse tragen dazu bei, Genauigkeit, Zuverlässigkeit und die Einsatzbereitschaft von Modellen für die Entwicklung von KI-Anwendungen im Gesundheitswesen sicherzustellen.

Ja. Die medizinischen Datensätze von Shaip sind sowohl für kleine Pilotprojekte als auch für KI/ML-Projekte in Unternehmen skalierbar. Sie eignen sich für Projekte, die große Mengen an Patientenakten, strukturierten klinischen Daten, Transkripten oder Hunderttausende Stunden an ärztlichen Diktaten benötigen.

Ja. Shaip liefert medizinische Datensätze in sofort einsatzbereiten Formaten wie JSON, CSV, FHIR, WAV und als Transkriptdateien. Diese Formate unterstützen die Integration in bestehende Workflows zur Entwicklung von KI-, ML-, NLP-, Sprach-, Gesundheits-LLM- und multimodalen Modellen.

Standardmäßige medizinische Datensätze können in der Regel innerhalb weniger Tage nach Musterprüfung, Vertragsunterzeichnung und endgültiger Lizenzierung geliefert werden. Individuelle Erfassungszeiträume hängen vom Projektumfang, der Datensatzgröße, der Modalität, den Compliance-Anforderungen und der Komplexität ab und werden in der Leistungsbeschreibung festgelegt.

Die Kosten für medizinische Datensätze hängen von Datensatztyp, Modalität, Umfang, Anpassungsanforderungen, Lizenzbedingungen, Lieferzeit und Compliance-Anforderungen ab. Teams können ihre Anforderungen über das Kontaktformular mitteilen, um ein individuelles Angebot zu erhalten.

Hochwertige medizinische Datensätze sind unerlässlich für das Training präziser, zuverlässiger und klinisch nützlicher KI-Modelle im Gesundheitswesen. Sie tragen zur Verbesserung der medizinischen Dokumentation, der klinischen NLP, der Spracherkennung, der Zusammenfassung, der Entscheidungsunterstützung, der Automatisierung, der Arbeitsabläufe in der Patientenversorgung und der Datenanalyse im Gesundheitswesen bei.