Was ist Data Provenance?
Data Provenance ist der Nachweis, woher ein Datenwert stammt. Das deutsche Wort dafür ist Datenherkunft. Der Nachweis nennt die Quelle eines Werts, die Person oder das Programm hinter dem Eintrag und den Zeitpunkt des Eintrags. Damit kann ein Unternehmen eine Angabe prüfen, bevor es sich auf sie verlässt.
Was zur Herkunft von Daten gehört
Das W3C beschreibt Provenance als Information über die Entitäten, Aktivitäten und Personen, die an der Entstehung von Daten beteiligt waren (W3C PROV, Überblick). Das Datenmodell kennt drei Grundtypen. Eine Entität sind die Daten selbst, etwa ein Datensatz oder eine Datei. Eine Aktivität ist das, was mit ihnen geschah, etwa ein Import oder eine Bearbeitung. Ein Agent ist die Person, die Organisation oder das Programm, das dafür verantwortlich ist.
Für einen Wert in einer Kundentabelle sind das vier Fragen. Welche Quelle nennt den Wert? Wer hat ihn eingetragen? Wann wurde er eingetragen? Ab wann galt er?
Die meisten Datenbanken in Unternehmen können diese Fragen nicht beantworten. Sie halten pro Feld einen Wert und überschreiben ihn bei einer Änderung. Der alte Wert ist dann verloren, und seine Quelle ist es auch.
Data Provenance und Data Lineage im Vergleich
Beide Begriffe werden oft für dasselbe verwendet. Wo sie getrennt werden, liegt der Unterschied hier:
| Data Provenance | Data Lineage | |
|---|---|---|
| Frage | Woher stammt dieser Wert? | Welchen Weg haben die Daten durch die Systeme genommen? |
| Betrachtet | Einen Fakt oder einen Datensatz | Eine Tabelle, einen Bericht oder eine Pipeline |
| Hält fest | Quelle, Urheber und Daten eines Werts | Quellsysteme, Umformungen und Zieltabellen |
| Typischer Einsatz | Eine Redakteurin prüft einen Wert vor der Veröffentlichung | Ein Data Engineer sucht den Fehler in einem Bericht |
Data Lineage zeigt, dass die Spalte eines Berichts aus einer Tabelle im CRM geladen wurde. Data Provenance zeigt, dass die Adresse in einem Datensatz des CRM aus einem Eintrag im Handelsregister stammt.
Warum die Herkunft von Daten für KI wichtig ist
Ein KI-Assistent, der aus den Datensätzen eines Unternehmens antwortet, wiederholt, was dort steht. Er gibt keinen Hinweis, wenn eine Adresse veraltet ist. Stehen an einem Wert seine Quelle und sein Datum, kann der Leser der Antwort die Angabe einordnen. Ohne beides muss er der Antwort glauben oder den Wert selbst nachschlagen.
Wie eine Datenbank die Herkunft speichert
Ein Weg ist, einen Fakt als eigene Angabe zu speichern. Die Datenbank weiß dann, woher ein Fakt stammt und wann er galt. Eine Angabe hält den Wert fest, wer ihn eingetragen hat, welche Quelle er nennt und wie vertrauenswürdig diese Quelle ist. Eine Korrektur fügt eine neue Angabe hinzu und blendet die alte aus. Die Datenbank zeigt weiterhin, was sie vorher gesagt hat.
Eine Angabe trägt zwei Daten. Das erste sagt, wann der Fakt galt. Das zweite sagt, wann die Datenbank von ihm erfahren hat. Der Fachbegriff ist bitemporale Modellierung. Mit dieser Historisierung von Daten beantwortet der Speicher zwei Fragen: Was galt an einem bestimmten Tag, und was hielten wir an diesem Tag für wahr?
Die Herkunft braucht ein festes Objekt, auf das sie zeigt. Beschreiben zwei Datensätze dasselbe Unternehmen, gehören ihre Quellen zusammen. Das Stammdatenmanagement legt die Regeln dafür fest, und die Objektidentität entscheidet, welche Datensätze dasselbe Ding in der Welt meinen.
Meine Arbeit an der Datenherkunft
Ich bin IT-Experte für Datenplattformen. Seit mehr als zwanzig Jahren baue ich Datenbanken und die Werkzeuge um sie herum. Bei einer globalen Immobiliendatenbank habe ich die Datenbanken selbst programmiert.
Heute arbeite ich an der Informationsplattform eines Kunden. Dort sind die Angaben, die zwei Daten und der Vertrauensrang im Produktiveinsatz. W3C PROV-O nutze ich als Referenz, und ich bezeichne den Speicher nicht als konform dazu. Eine Zusammenführung von Dubletten hält den stillgelegten Datensatz als Alias fest, und eine falsche Zusammenführung lässt sich zurücknehmen. Claude und Codex beschleunigen diese Arbeit nach Regeln, die eine Maschine prüft.
Wenn ich für ein Unternehmen die Datenqualität verbessere, messe ich zuerst. Eine der Zählungen ist, wie viele Datensätze weder eine Quelle noch ein Datum nennen. Diese Arbeit übernehme ich als Freelancer oder in Festanstellung.
Suchanfragen zu diesem Thema
- was ist data provenance
- was ist data lineage
- herkunft von daten
- rückverfolgbarkeit daten
- historisierung von daten
- datenqualität definition
- datenqualität ki
- datenqualität messen
- datenqualität verbessern
- datenqualität sicherstellen
- dubletten