Aufbau und Betrieb eines Internet-Crawlers
Zuverlässige Bereitstellung der wöchentlichen Daten.
Aufgaben
Aufbau, Wartung und Betrieb eines Hadoop-Clusters mit Internet-Crawler (Apache Nutch, Apache Solr, Java) und wöchentlichen Massendatenauswertungen (Apache Hive).
Eingesetzte Technologien
NutchSolrJavaHiveHadoopBigdata