Diese Erweiterung dient der strukturierten Beschreibung des Bearbeitungsstatus eines Dokuments innerhalb eines NLP-Projekts. Die Verarbeitung von Dokumenten mit unstrukturierter Information erfolgt typischerweise in einer Vielzahl aufeinanderfolgender Verarbeitungsschritte. Im Verlauf dieser Prozessketten entstehen unterschiedliche Transformationen des Originaldokuments sowie Relationen zwischen dem Ursprungsdokument und daraus abgeleiteten Zwischenprodukten.
Die NLP Extension stellt hierfür ein Codesystem bereit, mit dem die verschiedenen Bearbeitungszustände und Zwischenprodukte eines NLP-Workflows konsistent beschrieben und archiviert werden können.
Das Codesystem der NLP Extension ist hierarchisch aufgebaut und umfasst zwei Ebenen: Level 1 (Lvl 1) und Level 2 (Lvl 2). Lvl 1 beschreibt einen übergeordneten Prozessstatus, beispielsweise annotated. Lvl 2 dient der Spezifikation dieses Status. Ein Beispiel ist die Kombination Lvl 1: annotated, Lvl 2: deid, die anzeigt, dass ein Dokument mit de-identifizierenden Annotationen versehen wurde.
Die Nutzung beider Hierarchieebenen ist nicht verpflichtend. Abhängig vom jeweiligen Anwendungsszenario kann frei entschieden werden, ob nur der übergeordnete Status (Lvl 1) oder zusätzlich eine spezifische Ausdifferenzierung über Lvl 2 verwendet wird.
Bitte beachten: wird eine Lvl 2 Spezifikation genutz wie z.B. deid muss auch zwingend das dazugehörige Lvl 1 annotated verwendet werden. Andernfalls könnte deid als vollständig de-identifiziertes Dokument missverstanden werden.
Ein exemplarischer Anwendungsfall ist ein Dokument innerhalb eines Annotationsprojekts, das bereits aus einem Quellsystem extrahiert und anonymisiert wurde. Bis zum aktuellen Bearbeitungsstand können mehrere Verarbeitungsschritte erfolgt sein, beispielsweise:
.pdf zu .txt (preprocessed – format-change)preprocessed – content-change)annotated – preanno deid)annotated – deid)surrogated)Die NLP Extension lässt bewusst Freiheitsgrade bei der Dokumentation solcher Prozessketten. Es ist möglich, sämtliche Verarbeitungsschritte eines Dokuments abzubilden. Alternativ kann sich die Beschreibung auf ausgewählte, für den jeweiligen Anwendungsfall wesentliche Bearbeitungszustände beschränken, beispielsweise ausschließlich auf den finalen Status surrogated.
| Name | Status | Version | Canonical | Basis |
|---|---|---|---|---|
| MII_EX_Dokument_NLP_Processing_Status | active | 2026.0.1 | https://www.medizininformatik-initiative.de/fhir/ext/modul-dokument/StructureDefinition/mii-ex-dokument-nlp-processing-status | http://hl7.org/fhir/StructureDefinition/Extension |
| MII_EX_Dokument_NLP_Processing_Status (Extension) | C | Extension | |
| id | 0..1 | string | |
| extension | C | 0..0 | Extension |
| url | 1..1 | uriFixed Value | |
| value[x] | S | 1..1 | CodeableConcept |
| id | 0..1 | string | |
| extension | C | 0..* | Extension |
| coding | S Σ | 1..* | CodingBinding |
| id | 0..1 | string | |
| extension | C | 0..* | Extension |
| system | S Σ | 1..1 | uriFixed Value |
| version | Σ | 0..1 | string |
| code | S Σ | 1..1 | code |
| display | Σ | 0..1 | string |
| userSelected | Σ | 0..1 | boolean |
| text | Σ | 0..1 | string |
Status der NLP-Verarbeitung des referenzierten Dokuments |
| Feldname | Kurzbeschreibung |
|---|---|
| Extension.value[x] | NLP Processing Status |
| Extension.value[x].coding | |
| Extension.value[x].coding.system | |
| Extension.value[x].coding.code |
This code system https://www.medizininformatik-initiative.de/fhir/ext/modul-dokument/CodeSystem/mii-cs-dokument-nlp-processing-status defines the following codes:
| Code | English (English, en) |
|---|---|
| unprocessed | Original document |
| preprocessed | Preprocessed document |
| annotated | Annotated document |
| surrogated | Surrogated document |
Das folgende Beispiel illustriert die Verarbeitung eines ärztlichen Entlassbriefes der Patientin Amanda Alzheimer durch eine NLP-Pipeline (siehe Abbildung). Nach der Erschließung (Ingestion) des Originaldokuments Amanda_Alzheimer.docx wird eine Dokumentreferenz mit dem NLP-Verarbeitungsstatus unprocessed angelegt. Anschließend wird das Dokument durch eine Vorverarbeitung (Preprocessing) in das Klartextformat Amanda_Alzheimer.txt überführt. Die zugehörige Dokumentreferenz kennzeichnet den NLP-Verarbeitungsstatus preprocessed, format-change und verweist mittels transforms auf das Originaldokument. Anschließend wird eine De-Identifikation (De-Identification) der Inhalte durchgeführt, um das Ergebnisdokument De-ID.txt datenschutzkonform für Forschungszwecke weiterverwenden zu können. Eine zugehörige Dokumentreferenz kennzeichnet den NLP-Verarbeitungsstatus preprocessed, format-change, surrogated und verweist mittels transforms auf das Klartextdokument. Abschließend werden die klinischen Inhalte annotiert, was unter Umständen mehrere Ergebnisdateien produziert und sich als Archiv Annotat.zip zusammenfassen lassen. Die zugehörige Dokumentreferenz kennzeichnet den NLP-Verarbeitungsstatus durch die akkumulierten Codes der vorangegangenen Stufen als [annotated, semantic], surrogated, [preprocessed, format-change] und erweitert mittels appends die Dokumentreferenz des vorherigen NLP-Verarbeitungsschritts.
Bitte beachten: Mit dem Element relates to können Beziehungen zwischen den unterschiedlichen Referenzen eines Dokumentes hergestellt werden. Die Codebezeichnungen transforms und appends bezeichnen hierbei die Art der Beziehung:
transforms: Dieses Dokument hat seinen Ursprung im relationierten Original aber wurde inhaltlich oder strukturell verändert. Zum Beispiel wenn ein Original Dokument im CDA-Format in ein Textformat übertragen wurde.appends: Dieses Dokument basiert auf dem relationierten Dokument, enthält aber zusätzliche Informationen wie z.B. Annotation in Form von Metadaten erhalten.Die folgenden FHIR DocumentReference-Ressourcen verwendeten das Dokument-Profil (Dokument: DocumentReference), um die Ergebnisdokumente und die zugehörigen Dokumentreferenzen jedes Verarbeitungsschrittes der NLP-Pipeline darzustellen.
Die folgenden FHIR-Ressourcen stellen die zum Beispiel zugehörigen FHIR Patienten- und Fall-Ressourcen dar. Diese FHIR-Ressourcen werden ausschließlich vom Originaldokument Amanda_Alzheimer.docx und der zugehörigen Dokumentreferenz verwendet.
Quelle: GraSCCo Datensatz, DOI (Zenodo): 10.5281/zenodo.6539130