Zum Inhalt springen

Forschung

Wissensmanagement und Entity Resolution - die Schubladen eines Zettelkatalogs, eine Karte pro Ding
Ein Zettelkatalog in einer Bibliothek: eine Karte pro Ding, abgelegt unter einem Schlüssel.

Mein Forschungsgebiet ist die Verwaltung von Wissen über Dinge der realen Welt. Dazu gehören Entity Resolution und Record Linkage, Deduplizierung, Stammdatenmanagement und die Integration von Daten über Systemgrenzen hinweg. Data Provenance und Data Lineage sagen, woher ein Fakt stammt, temporale Daten sagen, wann er galt, und ein Knowledge Graph hält fest, wie die Dinge zusammenhängen. An diesen Problemen arbeite ich seit mehr als zwanzig Jahren, in mehreren Informationssystemen, die ich gebaut habe. Die meisten Organisationen haben sie nicht gelöst, und KI bietet heute einfachere Wege dorthin als die Werkzeuge, die ich früher hatte.

Dasselbe Ding, vielfach beschrieben

Viele Organisationen beschreiben dieselben realen Dinge: ein Unternehmen, ein Produkt, einen Ort, eine Person. Jede führt ihren eigenen Datensatz unter ihrer eigenen Kennung, und einen gemeinsamen Schlüssel gibt es nicht. Die Datensätze widersprechen sich und sind unterschiedlich alt. Eine gleiche Bezeichnung beweist keine gleiche Bedeutung: Zwei Systeme können beide ein Feld „Größe“ haben und damit Verschiedenes messen.

Entity Resolution heißt, zu entscheiden, welche Datensätze ein und dasselbe Ding beschreiben. Ein gemeinsamer Name oder eine gemeinsame Adresse reicht dafür nicht, und eine falsche Zusammenführung zerstört Informationen, die sich nur schwer zurückholen lassen.

Dasselbe Problem in einer Organisation

Das Problem gibt es auch innerhalb einer einzelnen Organisation. Das Kundensystem, das Abrechnungssystem und die Tabelle einer Abteilung halten jeweils eine eigene Kopie desselben Kunden, und die Kopien entfernen sich von dem Datensatz, aus dem sie stammen. Jeder Import bringt neue Dubletten, deshalb ist Deduplizierung eine Daueraufgabe.

Ein Fakt steht oft ohne Quelle und ohne Datum in einem System. Niemand kann sagen, wer ihn eingetragen hat oder ob er noch stimmt. Wenn die Leute gehen, die es wussten, geht das Wissen mit ihnen.

Woran ich arbeite

Meine Antworten bestehen in jedem System aus denselben Teilen. Jedes Ding bekommt eine Identität, die über Datensätze, Systeme und Jahrzehnte hinweg gilt. Jeder Fakt wird als Aussage gespeichert, mit seiner Quelle, seinem Urheber, dem Zeitpunkt, an dem er beobachtet wurde, und der Zeit, in der er zutraf. Eine Korrektur fügt eine Aussage hinzu und überschreibt nichts. Quellen bekommen einen Vertrauensrang, sodass ein Widerspruch zwischen zwei Quellen nach einer Regel entschieden wird, die sich erklären lässt.

Datensätze, die dasselbe Ding beschreiben, werden verknüpft und behalten ihre eigenen Daten. So lässt sich eine falsche Verknüpfung rückgängig machen. Definitionen, Taxonomien und Matching-Regeln sind versionierte Inhalte, die ein Redakteur prüfen kann, und sie stehen nicht im Programmcode. Andere Systeme lesen und schreiben über eine einzige Schnittstelle, unter den Regeln, die auch für einen menschlichen Redakteur gelten.

Was KI ändert

Die meiste Zeit dieser zwanzig Jahre war der teure Teil Handarbeit: unstrukturierte Quellen lesen, Datensätze vergleichen, Fakten extrahieren und Definitionen konsistent halten. Sprachmodelle erledigen diese Arbeit zu Kosten, die ein kleines Team tragen kann. Ein Modell liest ein Dokument und schlägt die Fakten darin vor. Es vergleicht zwei Datensätze und nennt seine Belege. Ein Agent übernimmt Kuratierungsarbeit, für die bisher niemand Zeit hatte.

Die Grenzen sind ebenso klar. Ein Modell erfindet Fakten und führt zusammen, was nicht zusammengehört. Deshalb setzt sich ein hoher Match-Score nie über einen harten Widerspruch hinweg, jeder vorgeschlagene Fakt nennt seine Quelle, eine unvollständige Extraktion bleibt als unvollständig markiert, und an den Freigabepunkten entscheidet ein Mensch. Der Agent ist eine austauschbare Arbeitskraft. Identität, Regeln und Herkunft bleiben im Datenspeicher. Daraus folgt mein zweites Forschungsfeld: wie ein Unternehmen arbeitet, wenn die meisten seiner Mitarbeiter Software-Agenten sind.

Wie Informationen durch ein solches System fließen

Das Diagramm zeigt den Weg, den ich in jedem Projekt baue. Die Seiten darunter gehen die Teile einzeln durch: die Frage, das Modell, zu dem ich gekommen bin, was gebaut und gemessen ist und was noch offen ist.

Gleisplan: Quellen, Prüfpunkte, Speicher, Abnehmer Register und offene Daten Dokumente und Web Nutzer und KI-Agenten Abgleich der Kennung Feldregeln Textprüfung Speicher Objekt Fakt Zeit Quelle Suchindex API und SDK KI-Agenten über MCP Exporte und Berichte
Die Daten kommen links aus den Quellen, passieren die Prüfpunkte und landen in einem Speicher, in dem jeder Fakt sein Objekt, seine Zeit und seine Quelle behält. Von dort gehen sie an die Systeme, die sie lesen.

Forschung, Seite für Seite

Suchanfragen zu diesem Thema

  • Wissensmanagement
  • Wissensmanagement mit KI
  • Wissensmanagement im Unternehmen
  • Wissensmanagement im Mittelstand
  • Entity Resolution
  • Record Linkage
  • Deduplizierung
  • Dublettenbereinigung
  • Stammdatenmanagement
  • Stammdatenmanagement KI
  • Stammdatenpflege KI
  • Datenintegration
  • Datenqualität
  • Datenqualitätsmanagement
  • Data Lineage
  • Data Lineage Deutsch
  • Temporale Daten
  • Wissensgraph
  • Wissensgraph KI
  • Knowledge Graph Deutsch
  • Datenmanagement
  • Data Governance
  • Single Source of Truth
  • Wissensverlust in Unternehmen
  • Wissensverlust durch Fluktuation
  • Wissen im Unternehmen halten
  • KI Datenqualität
  • Datenqualität verbessern
  • Informationsmanagement
  • Wissensdatenbank Unternehmen