Forschung
Mein Forschungsgebiet ist die Verwaltung von Wissen über Dinge der realen Welt. Dazu gehören Entity Resolution und Record Linkage, Deduplizierung, Stammdatenmanagement und die Integration von Daten über Systemgrenzen hinweg. Data Provenance und Data Lineage sagen, woher ein Fakt stammt, temporale Daten sagen, wann er galt, und ein Knowledge Graph hält fest, wie die Dinge zusammenhängen. An diesen Problemen arbeite ich seit mehr als zwanzig Jahren, in mehreren Informationssystemen, die ich gebaut habe. Die meisten Organisationen haben sie nicht gelöst, und KI bietet heute einfachere Wege dorthin als die Werkzeuge, die ich früher hatte.
Dasselbe Ding, vielfach beschrieben
Viele Organisationen beschreiben dieselben realen Dinge: ein Unternehmen, ein Produkt, einen Ort, eine Person. Jede führt ihren eigenen Datensatz unter ihrer eigenen Kennung, und einen gemeinsamen Schlüssel gibt es nicht. Die Datensätze widersprechen sich und sind unterschiedlich alt. Eine gleiche Bezeichnung beweist keine gleiche Bedeutung: Zwei Systeme können beide ein Feld „Größe“ haben und damit Verschiedenes messen.
Entity Resolution heißt, zu entscheiden, welche Datensätze ein und dasselbe Ding beschreiben. Ein gemeinsamer Name oder eine gemeinsame Adresse reicht dafür nicht, und eine falsche Zusammenführung zerstört Informationen, die sich nur schwer zurückholen lassen.
Dasselbe Problem in einer Organisation
Das Problem gibt es auch innerhalb einer einzelnen Organisation. Das Kundensystem, das Abrechnungssystem und die Tabelle einer Abteilung halten jeweils eine eigene Kopie desselben Kunden, und die Kopien entfernen sich von dem Datensatz, aus dem sie stammen. Jeder Import bringt neue Dubletten, deshalb ist Deduplizierung eine Daueraufgabe.
Ein Fakt steht oft ohne Quelle und ohne Datum in einem System. Niemand kann sagen, wer ihn eingetragen hat oder ob er noch stimmt. Wenn die Leute gehen, die es wussten, geht das Wissen mit ihnen.
Woran ich arbeite
Meine Antworten bestehen in jedem System aus denselben Teilen. Jedes Ding bekommt eine Identität, die über Datensätze, Systeme und Jahrzehnte hinweg gilt. Jeder Fakt wird als Aussage gespeichert, mit seiner Quelle, seinem Urheber, dem Zeitpunkt, an dem er beobachtet wurde, und der Zeit, in der er zutraf. Eine Korrektur fügt eine Aussage hinzu und überschreibt nichts. Quellen bekommen einen Vertrauensrang, sodass ein Widerspruch zwischen zwei Quellen nach einer Regel entschieden wird, die sich erklären lässt.
Datensätze, die dasselbe Ding beschreiben, werden verknüpft und behalten ihre eigenen Daten. So lässt sich eine falsche Verknüpfung rückgängig machen. Definitionen, Taxonomien und Matching-Regeln sind versionierte Inhalte, die ein Redakteur prüfen kann, und sie stehen nicht im Programmcode. Andere Systeme lesen und schreiben über eine einzige Schnittstelle, unter den Regeln, die auch für einen menschlichen Redakteur gelten.
Was KI ändert
Die meiste Zeit dieser zwanzig Jahre war der teure Teil Handarbeit: unstrukturierte Quellen lesen, Datensätze vergleichen, Fakten extrahieren und Definitionen konsistent halten. Sprachmodelle erledigen diese Arbeit zu Kosten, die ein kleines Team tragen kann. Ein Modell liest ein Dokument und schlägt die Fakten darin vor. Es vergleicht zwei Datensätze und nennt seine Belege. Ein Agent übernimmt Kuratierungsarbeit, für die bisher niemand Zeit hatte.
Die Grenzen sind ebenso klar. Ein Modell erfindet Fakten und führt zusammen, was nicht zusammengehört. Deshalb setzt sich ein hoher Match-Score nie über einen harten Widerspruch hinweg, jeder vorgeschlagene Fakt nennt seine Quelle, eine unvollständige Extraktion bleibt als unvollständig markiert, und an den Freigabepunkten entscheidet ein Mensch. Der Agent ist eine austauschbare Arbeitskraft. Identität, Regeln und Herkunft bleiben im Datenspeicher. Daraus folgt mein zweites Forschungsfeld: wie ein Unternehmen arbeitet, wenn die meisten seiner Mitarbeiter Software-Agenten sind.
Wie Informationen durch ein solches System fließen
Das Diagramm zeigt den Weg, den ich in jedem Projekt baue. Die Seiten darunter gehen die Teile einzeln durch: die Frage, das Modell, zu dem ich gekommen bin, was gebaut und gemessen ist und was noch offen ist.
Forschung, Seite für Seite
-
Objekte über Anwendungsgrenzen hinweg verfolgen
Viele Datensätze beschreiben dasselbe Ding, und Systeme sind sich selten einig, wann zwei davon ein Objekt meinen. Ich will herausfinden, wie man das entscheidet.
-
Woher ein Fakt stammt und wann er galt
Datenbanken vergessen, woher ein Fakt stammt und wann er galt. Ich will beides behalten.
-
Datenqualität zu sichern ist eine Herausforderung
KI-Agenten lesen zweifelhafte Quellen und schreiben in gemeinsame Daten. Bleibt das mit einem Regelwerk verlässlich?
-
Änderungsmanagement und Workflows
Dubletten zusammenführen und Daten in großen Mengen ändern kann gute Datensätze zerstören. Ich arbeite an Änderungen, die sich immer rückgängig machen lassen.
-
Virtuelle Organisationen autonomer Agenten
KI-Agenten können wie ein Team arbeiten, doch wie man sie verlässlich führt, wissen bisher wenige. Ich teste, wie Rollen und Regeln sie in der Spur halten.
Suchanfragen zu diesem Thema
- Wissensmanagement
- Wissensmanagement mit KI
- Wissensmanagement im Unternehmen
- Wissensmanagement im Mittelstand
- Entity Resolution
- Record Linkage
- Deduplizierung
- Dublettenbereinigung
- Stammdatenmanagement
- Stammdatenmanagement KI
- Stammdatenpflege KI
- Datenintegration
- Datenqualität
- Datenqualitätsmanagement
- Data Lineage
- Data Lineage Deutsch
- Temporale Daten
- Wissensgraph
- Wissensgraph KI
- Knowledge Graph Deutsch
- Datenmanagement
- Data Governance
- Single Source of Truth
- Wissensverlust in Unternehmen
- Wissensverlust durch Fluktuation
- Wissen im Unternehmen halten
- KI Datenqualität
- Datenqualität verbessern
- Informationsmanagement
- Wissensdatenbank Unternehmen