Arvato Bertelsmann

KNIME-ETL für konsistente Datenprozesse bei Arvato Bertelsmann

Wenn Daten aus Dateien und Datenbanken unterschiedlich aufgebaut sind, wird jede Auswertung zur erneuten Aufbereitungsaufgabe. Deka Technology entwickelte einen KNIME-basierten ETL-Prozess, der Daten strukturiert extrahiert, bereinigt, prüft und für die weitere Nutzung bereitstellt.

Leistungsbereich
Daten & KI
Weitere Kompetenzen
  • Enterprise Integration

Projektüberblick

Kunde
Arvato Bertelsmann
Schwerpunkt
Datenintegration und ETL-Automatisierung
Leistungsbereiche
Data & AI; Enterprise Integration innerhalb von Software Engineering & Modernization
Quellen
Excel, CSV und Datenbanken
Zielsystem
Microsoft SQL Server

Herausforderung

Die relevanten Daten lagen in Excel-Dateien, CSV-Exporten und Datenbanksystemen vor. Für eine verlässliche Weiterverarbeitung mussten Formate vereinheitlicht, Datentypen abgeglichen, Qualitätsregeln angewendet und fehlerhafte Datensätze nachvollziehbar behandelt werden.

Gesucht war deshalb kein einmaliger Import, sondern ein wiederholbarer Prozess für die regelmäßige Verarbeitung der ausgewählten Datenquellen.

Rolle von Deka Technology

Deka Technology konzipierte und implementierte den ETL-Workflow in KNIME. Der Umfang umfasste die Anbindung der Quellen, Transformations- und Bereinigungslogik, Validierungsregeln, Datenanreicherung, Fehlerbehandlung sowie das Laden der aufbereiteten Daten in Microsoft SQL Server.

Der Workflow wurde für eine regelmäßige automatisierte Ausführung aufgebaut.

Vorgehen

  1. Quellen anbinden

    KNIME-Connectoren führten Daten aus Excel, CSV und Datenbanken in einem definierten Prozess zusammen.

  2. Strukturen vereinheitlichen

    Bereinigung, Datentypkonvertierung und Zusammenführung schufen eine konsistente Verarbeitungsebene.

  3. Daten prüfen und anreichern

    Validierungsregeln und projektspezifische Skripte unterstützten Qualitätskontrolle und Ergänzung der Datensätze.

  4. Ausnahmen transparent behandeln

    Fehlerbehandlung machte unvollständige oder nicht verarbeitbare Datensätze innerhalb des Workflows sichtbar.

  5. Bereitstellung automatisieren

    Die vorbereiteten Daten wurden in Microsoft SQL Server geladen und der Ablauf für die regelmäßige Ausführung eingerichtet.

Ergebnisse

Der umgesetzte Workflow bündelte Aufbereitung und Integration der ausgewählten Datenquellen in einem standardisierten Ablauf. Wiederholbare Validierung und Fehlerbehandlung unterstützten eine konsistente, nachvollziehbare Verarbeitung.

Die aufbereiteten Daten standen damit in Microsoft SQL Server für Analysen und operative Entscheidungen bereit.

Technologie

  • KNIME
  • Microsoft SQL Server
  • PostgreSQL

Deka Technology

Ähnliches Vorhaben besprechen

Beschreiben Sie im Kontaktformular Ihre Datenquellen, Qualitätsregeln und Zielsysteme. Deka Technology kann mit Ihnen den Umfang eines wiederholbaren KNIME-ETL-Prozesses eingrenzen.

Kontaktformular öffnen