Data Engineering
Einmal oder regelmäßig? Egal ob beim Vertriebsbericht, den Quartalszahlen, dem KI-Modell, der Marktbeobachtung oder dem Performance-Dashboard: Fast immer tritt dasselbe Problem auf. Die Zahlen sind gefunden, die Quellen erkannt, die Reports werden aktiv im Unternehmen genutzt – nur jeden Tag, jede Woche, jeden Monat oder jedes Quartal gibt es erneut Stress, wenn der Bericht aktualisiert werden muss.
An dieser Stelle helfen Data Engineers, die die Verarbeitung der Daten automatisieren, robuster gestalten, die Pipeline am Leben erhalten und so die Fachspezialisten entlasten.
Pipelines
Es haben sich diverse Open-Source-Werkzeuge zum Aufbau von Verarbeitungs-Pipelines (ETL) bewährt: Kafka, Hadoop, Hive, Spark, Nifi, Airflow und andere mehr. Ich durfte bereits mit vielen dieser Werkzeuge arbeiten und bringe einen breiten Erfahrungsschatz mit ein.
Betrieb
Der Betrieb einer Plattform hat verschiedene Facetten: Verfügbarkeit, Kosten, Wartung, Security. Unabhängig davon, ob Cloud oder On-Premise – in jedem Fall muss beim Aufbau eines Systems immer auch der spätere Regelbetrieb mitgedacht werden. Diese Erfahrung bringe ich mit.
Workflows
Daten stehen nie für sich allein. Erhebung, Verarbeitung und Nutzung müssen dokumentiert sein, die Nutzer müssen mit ihnen arbeiten können und ihnen vertrauen. Reden, erklären, zuhören, helfen, beraten – diese Kommunikation ist am Ende wichtiger als das schönste neue Tool.
Beratung
Vielleicht kenne ich mich mit einem Tool noch nicht perfekt aus, und die Algorithmen und Datenstrukturen aus dem Studium kann ich vermutlich nicht mehr auswendig herunterbeten. Ich bringe in Ihr Projekt und Ihr Team aber einen reichen Schatz an Erfahrungen ein und kenne viele Strategien, mit denen andere bereits erfolgreich waren.
KafkaHadoopHiveSparkNiFiAirflowBigdata