Studio Zweibrand GmbH
Data Engineer (w/m/d)
Modernisierung einer bestehenden Data-Warehouse-Landschaft durch Migration von Oracle-, Talend- und SAP-DS-Datenstrecken auf eine Azure Databricks Lakehouse-Plattform. Fokus auf Datenmigration, dbt-Modellierung, Datenqualität und Aufbau moderner ELT-Pipelines.
Aufgaben
- Analyse bestehender Oracle-, Talend- und SAP-Data-Services-Datenstrecken
- Aufnahme, Analyse und Dokumentation von Source-to-Target-Mappings
- Bewertung von Komplexität, Kritikalität, Abhängigkeiten und Migrationsaufwänden
- Migration bestehender ETL-Prozesse in moderne ELT- und Lakehouse-Architekturen
- Entwicklung und Implementierung von Datenpipelines auf Databricks
- Entwicklung von Transformationslogiken mit Spark SQL, PySpark und Delta Lake
- Modellierung von Datenstrukturen mit dbt nach Bronze-, Silver- und Gold-Layer
- Aufbau und Weiterentwicklung von Data-Marts für Reporting-, Analytics- und BI-Anwendungsfälle
- Sicherstellung der Datenqualität durch technische und fachliche Validierungen
- Durchführung von Datenabgleichen mittels Row-Count-, Hash- und Regressionstests
- Optimierung von Datenpipelines hinsichtlich Performance, Wartbarkeit und Skalierbarkeit
- Zusammenarbeit mit Plattform-, Architektur- und Fachbereichsteams bei der Migration in die neue Lakehouse-Plattform
- Unterstützung bei Data Governance, Lineage, Dokumentation und Berechtigungskonzepten
- Erstellung technischer Dokumentationen sowie Übergabe der migrierten Lösungen in den Betrieb
- Unterstützung im laufenden Betrieb bestehender Legacy-Datenstrecken und bei der schrittweisen Ablösung historischer Systeme
Qualifikationen
Qualifikationen Must-have
- Mehrjährige Erfahrung als Senior Data Engineer im Data-Warehouse-, Analytics- oder Migrationsumfeld
- Sehr gute SQL-Kenntnisse, insbesondere komplexe Joins, Window Functions, Aggregationen und Performance-Optimierung
- Fundierte Kenntnisse in Oracle SQL und PL/SQL
- Erfahrung mit klassischen Data-Warehouse-Architekturen und Legacy-DWH-Landschaften
- Erfahrung in der Analyse, Dokumentation und Migration von Talend-Datenstrecken
- Sehr gute Kenntnisse in Databricks inklusive Jobs, Workflows und Delta Lake
- Erfahrung mit Spark SQL und PySpark
- Kenntnisse moderner Lakehouse-Architekturen und Medallion-Konzepte (Bronze, Silver, Gold)
- Sehr gute Kenntnisse in dbt (Models, Sources, Tests, Snapshots, Incremental Models)
- Erfahrung bei der Migration von ETL- zu ELT-Architekturen
- Erfahrung in Datenqualitätsmanagement, Datenvalidierung und Regressionstests
- Sicherer Umgang mit Git, Branching-Strategien, Pull Requests und Code Reviews
- Erfahrung in der Erstellung technischer Dokumentationen und Source-to-Target-Mappings
- Fähigkeit zur Analyse komplexer Datenabhängigkeiten und fachlicher Datenlogiken
Qualifikationen Nice-to-have
- Kenntnisse in SAP Data Services
- Erfahrung mit Qlik sowie BI- und Reporting-Lösungen
- Kenntnisse in Unity Catalog, Data Governance und Data Lineage
- Erfahrung mit Kafka, Debezium und CDC-Architekturen
- Erfahrung mit Delta Live Tables
- Erfahrung im Performance-Tuning von Spark- und Databricks-Workloads
- Erfahrung mit Airflow und Workflow-Orchestrierung
- Gute Python-Kenntnisse zur Automatisierung, Validierung und Entwicklung technischer Utilities
- Kenntnisse in Data Modeling, Data Vault und dimensionalen Datenmodellen
- Erfahrung in Cloud-basierten Datenplattformen auf Azure
- Branchenkenntnisse im Telekommunikationsumfeld oder in vergleichbaren datenintensiven Unternehmen