Arvato Bertelsmann
KNIME-ETL für konsistente Datenprozesse bei Arvato Bertelsmann
Wenn Daten aus Dateien und Datenbanken unterschiedlich aufgebaut sind, wird jede Auswertung zur erneuten Aufbereitungsaufgabe. Deka Technology entwickelte einen KNIME-basierten ETL-Prozess, der Daten strukturiert extrahiert, bereinigt, prüft und für die weitere Nutzung bereitstellt.
- Leistungsbereich
- Daten & KI
- Weitere Kompetenzen
-
- Enterprise Integration
Projektüberblick
- Kunde
- Arvato Bertelsmann
- Schwerpunkt
- Datenintegration und ETL-Automatisierung
- Leistungsbereiche
- Data & AI; Enterprise Integration innerhalb von Software Engineering & Modernization
- Quellen
- Excel, CSV und Datenbanken
- Zielsystem
- Microsoft SQL Server
Herausforderung
Die relevanten Daten lagen in Excel-Dateien, CSV-Exporten und Datenbanksystemen vor. Für eine verlässliche Weiterverarbeitung mussten Formate vereinheitlicht, Datentypen abgeglichen, Qualitätsregeln angewendet und fehlerhafte Datensätze nachvollziehbar behandelt werden.
Gesucht war deshalb kein einmaliger Import, sondern ein wiederholbarer Prozess für die regelmäßige Verarbeitung der ausgewählten Datenquellen.
Rolle von Deka Technology
Deka Technology konzipierte und implementierte den ETL-Workflow in KNIME. Der Umfang umfasste die Anbindung der Quellen, Transformations- und Bereinigungslogik, Validierungsregeln, Datenanreicherung, Fehlerbehandlung sowie das Laden der aufbereiteten Daten in Microsoft SQL Server.
Der Workflow wurde für eine regelmäßige automatisierte Ausführung aufgebaut.
Vorgehen
-
Quellen anbinden
KNIME-Connectoren führten Daten aus Excel, CSV und Datenbanken in einem definierten Prozess zusammen.
-
Strukturen vereinheitlichen
Bereinigung, Datentypkonvertierung und Zusammenführung schufen eine konsistente Verarbeitungsebene.
-
Daten prüfen und anreichern
Validierungsregeln und projektspezifische Skripte unterstützten Qualitätskontrolle und Ergänzung der Datensätze.
-
Ausnahmen transparent behandeln
Fehlerbehandlung machte unvollständige oder nicht verarbeitbare Datensätze innerhalb des Workflows sichtbar.
-
Bereitstellung automatisieren
Die vorbereiteten Daten wurden in Microsoft SQL Server geladen und der Ablauf für die regelmäßige Ausführung eingerichtet.
Ergebnisse
Der umgesetzte Workflow bündelte Aufbereitung und Integration der ausgewählten Datenquellen in einem standardisierten Ablauf. Wiederholbare Validierung und Fehlerbehandlung unterstützten eine konsistente, nachvollziehbare Verarbeitung.
Die aufbereiteten Daten standen damit in Microsoft SQL Server für Analysen und operative Entscheidungen bereit.
Technologie
- KNIME
- Microsoft SQL Server
- PostgreSQL
Deka Technology
Ähnliches Vorhaben besprechen
Beschreiben Sie im Kontaktformular Ihre Datenquellen, Qualitätsregeln und Zielsysteme. Deka Technology kann mit Ihnen den Umfang eines wiederholbaren KNIME-ETL-Prozesses eingrenzen.