KI-Datenbereinigung

Über 10.000 Produktdatensätze bereinigt:
Aus Wochen wird eine Stunde.

Jede Datenlieferung brachte über 10.000 Produktdatensätze, gespickt mit versteckten Duplikaten, und Tage bis Wochen manueller Prüfung. Für DICON übernimmt das heute ein KI-Tool: Es erkennt zusammengehörige Produkte trotz unterschiedlicher Bezeichnungen und bereinigt einen ganzen Durchlauf in rund einer Stunde.

KI-gestützte Produktdaten-Deduplizierung für das IT-Systemhaus DICON: ein unübersichtlicher Haufen doppelter Produktdatensätze fließt zu einem einzigen, sauber zusammengeführten Datensatz zusammen.

Ausgangssituation

DICON betreut als IT-Systemhaus unter anderem das Produktmanagement eines umfangreichen Onlineshops. Für dessen Pflege treffen regelmäßig große Mengen Produktdaten aus unterschiedlichen Quellen ein, pro Durchlauf teilweise mehr als 10.000 Datensätze, die geprüft, aufbereitet und in das bestehende Produktmanagement übernommen werden müssen.

Das zentrale Problem: In den gelieferten Daten stecken zahlreiche Duplikate, die sich nicht ohne Weiteres erkennen lassen. Identische Produkte tragen unterschiedliche Namen, weichen in der Schreibweise ab oder stimmen nur in einzelnen Feldern überein. Ein einfacher Abgleich über Produktname oder Artikelnummer reichte deshalb nicht aus.

Vorher lief die Bereinigung größtenteils von Hand: Mehrere Mitarbeiter prüften die Datensätze, bauten eigene Lookup-Tabellen auf und ordneten zusammengehörige Produkte manuell zu. Bei Tausenden Produkten war das langwierig und fehleranfällig, eine vollständige Bereinigung konnte mehrere Tage bis Wochen dauern.

Lösung & Vorgehen

Wir haben ein eigenes KI-gestütztes Tool entwickelt, das die Produktdaten automatisiert analysiert, zuordnet und dedupliziert. Es betrachtet die relevanten Felder eines Datensatzes nicht nur auf exakte Übereinstimmung, sondern berücksichtigt auch den inhaltlichen Zusammenhang.

So erkennt das System, dass zwei unterschiedlich geschriebene oder unterschiedlich aufgebaute Datensätze dasselbe Produkt beschreiben. Auf Basis dieser erkannten Produktidentität erzeugt es eine eindeutige interne ID: Alle Datensätze desselben Produkts erhalten eine gemeinsame Identität und lassen sich anschließend automatisiert zusammenführen.

Das Tool ist bewusst nicht an ein einzelnes KI-Modell gebunden. DICON kann innerhalb der Anwendung zwischen den Modellen führender Anbieter wählen und so je nach Fall das beste Verhältnis aus Qualität, Geschwindigkeit und Kosten treffen: Komplexe Datensätze laufen über ein leistungsfähigeres Modell, standardisierte Prüfungen über ein günstigeres.

1
Daten importieren

Die vollständigen Produktdaten werden ins Tool geladen, ein einzelner Durchlauf umfasst teils mehr als 10.000 Datensätze.

2
Merkmale analysieren

Das System betrachtet mehrere Datenfelder gleichzeitig und untersucht direkte Übereinstimmungen ebenso wie inhaltliche Zusammenhänge.

3
Produkte zuordnen

Die KI bewertet, welche Datensätze trotz unterschiedlicher Bezeichnungen, Schreibweisen oder Strukturen zum selben Produkt gehören.

4
Produkt-ID bilden

Für jedes erkannte Produkt entsteht eine eindeutige interne ID als gemeinsame Klammer aller zugehörigen Datensätze.

5
Automatisch deduplizieren

Zusammengehörige Datensätze werden gruppiert, Duplikate bereinigt und die Produktinfos strukturiert weiterverarbeitet.

Screenshot · Modellauswahl und Dubletten-Erkennung im Tool
Pro Durchlauf ordnet das Tool zusammengehörige Produkte über mehrere Felder hinweg zu und führt sie zusammen.

Ergebnis

Was zuvor mehrere Mitarbeiter über Tage bis Wochen gebunden hätte, erledigt DICON heute in rund einer Stunde. Das System verarbeitet dabei mehr als 10.000 Produktdatensätze pro Durchlauf und erkennt Duplikate deutlich schneller und zuverlässiger als die manuelle Prüfung.

Die bereinigten Daten fließen direkt ins Produktmanagement des Onlineshops. Neue Datenlieferungen sind damit wesentlich schneller einsatzbereit, und die manuelle Prüf- und Zuordnungsarbeit sinkt drastisch.

Vorher
  • Bereinigung größtenteils von Hand über Tage bis Wochen
  • Duplikate über eigene Lookup-Tabellen mühsam gesucht
  • Zuordnung nur über Name oder Artikelnummer, oft unzuverlässig
Nachher
  • Über 10.000 Datensätze pro Durchlauf in rund einer Stunde
  • Duplikate trotz abweichender Bezeichnungen automatisch erkannt
  • Kontextbasierte Zuordnung über mehrere Datenfelder hinweg
Foto von Lars Pöbel
„Die versteckten Dubletten waren unser größter Zeitfresser. Heute lädt mein Team die Daten ins Tool, wählt das passende Modell und hat den ganzen Durchlauf in etwa einer Stunde sauber, wofür wir vorher Tage gebraucht haben.“
Lars Pöbel, Ansprechpartner @ DICON

Große Datenmengen automatisiert bereinigen?

Wir schauen uns eure Datenflüsse an und zeigen in einem kurzen Gespräch, wo ein KI-Tool Duplikate zuverlässig erkennt und eure Bereinigung von Tagen auf Stunden bringt.