Crawlen von Massendaten für ein Large-Language-Model (LLM)
Erfassung und Bereitstellung der Daten von bis zu 1 Mrd. Webseiten pro Monat.
Aufgaben
- Crawlen von Massendaten für ein US-amerikanisches Unternehmen.
- Aufbau, Installation und Erweiterung der Crawler-Software, Durchführung der Jobs, Tuning des Clusters (Hadoop-Cluster, Apache Nutch, Java, spezielle Export-Applikation).
Eingesetzte Technologien
HadoopNutchSolrJava