Zum Inhalt springen

Datenqualität verbessern: Beratung für Unternehmen in Deutschland

Wenn Sie die Datenqualität verbessern wollen, messe ich zuerst, wie viele Ihrer Kunden- und Produktdatensätze doppelt oder veraltet sind, und bereinige sie dann nach Regeln, deren Änderungen sich rückgängig machen lassen. Danach schließen wir die Wege, über die neue Fehler hereinkommen. Ich übernehme Freelance- und Projektarbeit, remote aus Frankfurt. Sprechen wir in einem kostenlosen Videocall von 30 Minuten über Ihren Bedarf.

Porträt von Michael Wutzke, Berater für Datenqualität in Deutschland
Michael Wutzke, Berater für Datenqualität in Deutschland

Was sich für Ihr Unternehmen ändert

  • Erfahrung mit Geschäftsdaten

    Seit mehr als zwanzig Jahren baue ich Datenbanken und die Werkzeuge dazu und frage bei jedem Datensatz, wie er in die Datenbank gelangt. Was ich zuerst bereinige, bestimmen die Menschen, die sich auf Ihre Daten verlassen.

  • Zahlen vor der Entscheidung

    Ich beginne mit einer Messung: wie viele Dublettenkandidaten Ihre Tabellen enthalten und wie viele Datensätze weder Quelle noch Datum nennen. Mit diesen Zahlen entscheiden Sie über die Bereinigung.

  • Zusammenführungen, die sich zurücknehmen lassen

    Ein zusammengeführter Datensatz bleibt mit seinen Kennungen als Alias des verbleibenden Datensatzes erhalten. Eine falsche Zusammenführung lässt sich in einem Schritt rückgängig machen, und ihre Historie bleibt erhalten.

  • Keine falschen Dubletten

    Zwei Unternehmen an einer Adresse bleiben zwei Unternehmen. Ein Widerspruch, etwa zwischen einem aufgelösten und einem aktiven Unternehmen, stoppt eine Zusammenführung, egal, was der Match-Score sagt.

  • Daten, mit denen Ihre KI-Werkzeuge arbeiten können

    Ein KI-Assistent wiederholt, was in Ihren Daten steht. Auf der Informationsplattform eines Kunden habe ich KI-Agenten an die Daten angebunden. Für sie gelten dieselben Regeln wie für die Mitarbeiter.

Was schlechte Datenqualität Ihr Unternehmen kostet

Schlechte Datenqualität heißt: Die Datensätze zu Kunden, Lieferanten oder Produkten stimmen nicht mehr mit der Wirklichkeit überein. Mitarbeiter merken das an einem Angebot, das an einen Kontakt geht, der das Unternehmen verlassen hat, oder an einem Bericht, der einen Kunden doppelt zählt.

In der Digitalisierungsumfrage der DIHK vom November 2025 unter 4.686 Unternehmen nannten 31 Prozent schlechte Datenqualität als Herausforderung bei der Nutzung ihrer Daten. Ein Jahr zuvor waren es 28 Prozent. Rechtsunsicherheit lag mit 60 Prozent vorn (DIHK, Januar 2026).

Datensätze veralten, weil sich die Dinge ändern, die sie beschreiben. Ein Unternehmen ändert seinen Namen, fusioniert oder schließt, und eine Ansprechpartnerin wechselt zu einem anderen Arbeitgeber. Eine Tabelle, die am Tag des Imports sauber war, veraltet von da an (Data Change Management).

KI-Werkzeuge machen das Problem sichtbarer. Ein Assistent, der aus Ihrem CRM antwortet, wiederholt eine veraltete Adresse und gibt keinen Hinweis darauf, dass sie falsch sein könnte.

Wie ich die Datenqualität verbessere

Ich messe zuerst. Danach bereinige ich nach Regeln, deren Änderungen sich rückgängig machen lassen. Zum Schluss bekommen die Stellen, an denen Fehler hereinkommen, eigene Prüfungen. Diese Regeln sind auf der Informationsplattform eines Kunden im produktiven Einsatz. Das Konzept steht auf der Seite Änderungsmanagement, Deduplizierung und Workflows.

Ein Dublettenscan meldet mehr als seine Zusammenführungen. Er listet auf, wie viele Kandidaten jedes Signal gefunden hat, wie viele ein Widerspruch ausgeschlossen hat und welche Paare unter der Schwelle für eine automatische Zusammenführung geblieben sind. Kandidaten ergeben sich aus Name, Adresse und gemeinsamen Nummern wie der USt-IdNr., denn der englische und der deutsche Name eines Unternehmens haben manchmal kein einziges Wort gemeinsam.

Ein hoher Match-Score setzt sich nicht über einen Widerspruch hinweg. Zwei Unternehmen können sich eine Adresse teilen, und die Standorte Werk Nord und Werk Süd gehören als zwei Werke zum selben Hersteller. Ein aufgelöstes Unternehmen und ein später an derselben Adresse gegründetes sind zwei verschiedene Unternehmen. Der Scan prüft solche Widersprüche, bevor er eine Zusammenführung schreibt.

Eine Zusammenführung legt einen Datensatz still und hält ihn mit seinen Kennungen als Alias des anderen fest. Eine Korrektur fügt den neuen Wert mit Quelle und Datum hinzu und blendet den alten aus. Beides lässt sich rückgängig machen, und die Historie zeigt, wer was geändert hat.

Paare, die sich nach den Regeln nicht entscheiden lassen, gehen an einen Menschen oder an einen KI-Agenten, für den dieselben Regeln gelten wie für die Mitarbeiter. Bei einer unsicheren Antwort bleiben beide Datensätze stehen.

Der letzte Schritt ist der Eingang. Neue Dubletten kommen über Importe, Webformulare und Mitarbeiter, die einen Kunden anlegen, den es schon gibt. Ein Importkonto darf Datensätze anlegen, aber keine bestehenden überschreiben, und ein Formular kann nach einem passenden Datensatz suchen, bevor es einen neuen anlegt.

Checkliste zur Datenqualität Ihrer Kundendaten

Diese Fragen gehe ich am Anfang einer Bereinigung durch. Sie können sie für Ihre eigene Kundentabelle beantworten.

  1. Wie viele Datensätze teilen sich eine USt-IdNr., eine Handelsregisternummer oder eine E-Mail-Domain mit einem anderen Datensatz?
  2. Wie viele Datensätze nennen weder eine Quelle noch das Datum ihrer letzten Prüfung?
  3. Wie viele Kunden in der Tabelle wurden aufgelöst oder umbenannt, nachdem sie erfasst wurden?
  4. Wie viele Kontakt-E-Mails kamen in den letzten zwölf Monaten als unzustellbar zurück?
  5. Welche Pflichtfelder sind leer, und bei welchem Anteil der Datensätze?
  6. Welche Werte widersprechen sich innerhalb eines Datensatzes, etwa eine deutsche Postleitzahl mit dem Ländercode für Österreich?
  7. Wer darf einen Kundendatensatz ändern, und wird jede Änderung mit ihrem Urheber protokolliert?
  8. Lässt sich eine falsche Änderung oder eine falsche Zusammenführung rückgängig machen?
  9. Über welche Wege kommen neue Datensätze herein: Importe, Webformulare, Mitarbeiter, andere Systeme?
  10. Welche Berichte und KI-Werkzeuge lesen diese Datensätze, und welche der Probleme oben erreichen sie?

Wer ich bin

Ich bin Michael Wutzke, arbeite von Frankfurt aus und habe mehr als zwanzig Jahre Erfahrung in IT und Medien. Bei einer globalen Immobiliendatenbank habe ich die Datenbanken selbst programmiert, und später habe ich mit Elasticsearch die Suche einer Immobiliendatenbank gebaut. Heute helfe ich einem Kunden, eine Informationsplattform mit KI-Agenten aufzubauen, die dieselben Regeln befolgen wie ein menschlicher Redakteur. Ich unterrichte im Claude Hacker House und baue Software mit Claude und Codex. Außerdem interessieren mich Open-Source-KI-Modelle, die ein Unternehmen auf eigenen Servern betreibt. Details: Berufliche Stationen.

So läuft die Bereinigung ab

  1. Kostenloser Videocall

    In 30 Minuten sprechen wir über die Datensätze, die Ärger machen, und die Systeme, in denen sie liegen.

  2. Gemeinsame Bestandsaufnahme

    Wir sehen uns Ihre Tabellen und die Wege an, auf denen neue Datensätze entstehen, und legen fest, welche Zahlen die Messung liefern soll.

  3. Angebot und Auftrag

    Sie erhalten ein Angebot für Messung und Bereinigung. Die Arbeit beginnt, wenn Sie es annehmen.

  4. Messung

    Ein Scan mit reinem Lesezugriff zählt Dublettenkandidaten pro Signal und Datensätze ohne Quelle. Eine geprüfte Stichprobe zeigt, wie weit man jedem Signal trauen kann.

  5. Bereinigung nach Regeln

    Zusammenführungen und Korrekturen laufen über die Speicherlogik Ihres Systems, sodass jede Änderung protokolliert wird. Paare, die sich nach den Regeln nicht entscheiden lassen, gehen an Ihre Mitarbeiter oder an einen KI-Agenten, und bei einer unsicheren Antwort bleiben beide Datensätze bestehen.

  6. Prüfungen am Eingang

    Importe bekommen ein Konto, das Datensätze anlegen, aber keine bestehenden überschreiben darf. Formulare suchen nach einem passenden Datensatz, bevor sie einen neuen anlegen.

  7. Übergabe

    Ihr Team erhält den Scan und führt ihn nach eigenem Zeitplan erneut aus. Die Zahlen zeigen, ob die Daten sauber bleiben.

Fragen, die Unternehmen stellen

Wie messen Sie Datenqualität?

Mit Zählungen auf Ihren eigenen Tabellen: Dublettenkandidaten pro Signal, Datensätze ohne Quelle oder Datum, leere Pflichtfelder und Kontakt-E-Mails, die als unzustellbar zurückkommen. Zu jeder Zählung gehört eine geprüfte Stichprobe, denn ein Signal, das stark aussieht, kann trotzdem zwei verschiedene Unternehmen zu einem Paar machen.

Kann KI unsere Daten bereinigen?

KI hilft bei den Paaren, die sich nach Regeln nicht entscheiden lassen. Auf der Informationsplattform eines Kunden prüfen KI-Agenten solche Paare nach denselben Regeln, die für die Mitarbeiter gelten. Ist ein Agent unsicher, bleiben beide Datensätze bestehen. Die Regeln für Zusammenführungen legen Menschen fest.

Brauchen Sie Zugriff auf unser Livesystem?

Für die Messung genügt ein Datenbankkonto mit reinem Lesezugriff oder eine Kopie. Korrekturen laufen unter einem eigenen Konto über die Speicherlogik oder die API Ihres Systems, sodass sich jeder Batch prüfen und rückgängig machen lässt.

Was unterscheidet das von Stammdatenmanagement?

Arbeit an der Datenqualität bereinigt die Datensätze in den Systemen, die Sie haben. Stammdatenmanagement legt fest, was als ein Kunde oder ein Produkt gilt und welches System führend ist, wenn mehrere Systeme dieselben Daten enthalten. Details: Beratung für Stammdatenmanagement.

Mit welchen Technologien arbeiten Sie?

Mit der Datenbank, auf der Ihre Systeme laufen, etwa MySQL, PostgreSQL oder Microsoft SQL Server, und mit Skripten in PHP oder Python. Elasticsearch hilft, wenn ein Scan in einer großen Tabelle ähnliche Namen finden muss. Eine erste Messung braucht keine neue Software.

Welche Formen der Zusammenarbeit bieten Sie an?

Freelance- und Projektarbeit, in Teilzeit oder Vollzeit. Ich arbeite remote aus Frankfurt und reise für Termine vor Ort dorthin, wo Ihr Team arbeitet.

Details zur Arbeit hinter dieser Seite

Datenqualität verbessern: Ihr Berater in Deutschland

Ich bin Michael Wutzke, Berater für Datenqualität in Deutschland, und arbeite von Frankfurt aus. In einem kostenlosen Videocall von 30 Minuten sprechen wir über die Datensätze, die in Ihrem Unternehmen Ärger machen, und Sie erfahren, welche Zahlen die Größe des Problems zeigen würden.

Porträt von Michael Wutzke, Berater für Datenqualität in Deutschland

Suchanfragen zu diesem Thema

  • Datenqualität verbessern
  • Datenqualität
  • Datenqualität sicherstellen
  • Datenqualitätssicherung
  • Datenqualitätsmanagement
  • Datenqualitätsmanagement Prozess
  • Datenqualität messen
  • Datenqualität prüfen
  • Datenqualität Kriterien
  • Datenqualität Dimensionen
  • Datenqualität Kennzahlen
  • Datenqualität Definition
  • Schlechte Datenqualität
  • CRM Datenqualität
  • Datenqualität für KI
  • Datenqualität KI
  • Stammdatenqualität verbessern
  • Stammdatenpflege
  • Dubletten
  • Dublettenprüfung
  • Dublettenbereinigung
  • Dublettencheck
  • Dublettenabgleich
  • Dublettenabgleich Software
  • Dubletten zusammenführen
  • Dubletten erkennen
  • Dubletten bereinigen
  • Datenbereinigung
  • Adressdaten bereinigen
  • Data Quality
  • Data Quality Consulting
  • Data Quality Management
  • Data Quality Consultant
  • Data Cleansing
  • Data Cleansing deutsch