Aufbau einer BigData-Datenverarbeitungs-Pipeline
Bereitstellung einer stabilen Datenversorgung für das Data-Science-Team.
Aufgaben
- Versorgung eines ML-Systems auf Basis einer Hadoop-BigData-Plattform.
- Anbindung von Datenquellen per Kafka Connect, Weiterverarbeitung per Kafka, NiFi, Airflow und Spark.
- Speicherung der Daten in Hive und PostgreSQL, Kapselung per Docker.
- Monitoring und Betrieb der Prozesse, Support der Anwender.
Eingesetzte Technologien
PythonBigdataKafkaNiFiAirflowSparkDockerHadoopGrafanaHive