Categories: Cloud

Googles MapReduce-Alternative Dataflow jetzt als Open Source

Das Cloud-Dataflow-SDK für Java hat Google jetzt als Open Source freigegeben. Im Sommer hat Google Cloud Dataflow auf der Entwicklerkonferenz Google I/O das Big-Data-Analyse-Tool zum ersten Mal der Öffentlichkeit vorgestellt. Google will damit eine “Plattform zur Demokratisierung der Datenverarbeitung im großen Maßstab” anbieten. Datenforscher, Datenanalysten und datenzentrierte Entwickler sollen damit einfacheren und besser skalierbaren Zugang zu Informationen erhalten.

Der Cloud-Dienst Dataflow ist aus der Java-Bibliothek Flume und dem Framework MillWheel hervorgegangen, die beide intern von Google-Entwicklern genutzt wurden. “Wir haben viel darüber gelernt, wie aus Daten Einsichten entstehen, während die ursprünglichen Programmiermodelle von FlumeJava (Grundlage für Cloud Dataflow) sich intern bei Google entwickelten”, So der Google Softwareentwickler Sam McVeety im Google Cloud Platform Blog.

Im Sommer hatte Urs Hölzle, Senior Vice President for Technical Infrastructure bei Google, mitgeteilt, Dataflow habe intern das zuvor im Unternehmen entwickelte MapReduce ersetzt, das lange als unverzichtbar bei der Verarbeitung großer Datenmengen auf Computerclustern galt.

Mit Cloud Dataflow als Lösung für Big-Data-Analyse tritt Google in Konkurrenz zu Angeboten wie dem Data-Warehouse-Dienst AWS Redshift und dem Hadoop-Dienst AWS Elastic MapReduce. Die Dataflow-Anwendungen können auf der Google Cloud Platform laufen, die dafür die gesamte benötigte Infrastruktur bereitstellt. Ein Managed Service sorgt für die Verarbeitung im Streaming- oder im Batch-Modus.

Das quelloffene Software Development Kit für Cloud Dataflow erlaubt aber auch lokale Anwendungen oder den Einsatz in anderen Clouds. Das Programmiermodell ist zudem nicht an eine bestimmte Sprache gebunden. “Wir arbeiten derzeit an einer Python-3-Version des SDKs, um Entwicklern noch mehr Wahlmöglichkeiten zu geben und Dataflow für weitere Anwendungen verfügbar zu machen”, schreibt McVeety weiter.

Das Google-Dataflow-SDK für Java ist auf GitHub verfügbar.

[mit Material von Bernd Kling, ZDNet.de]

Redaktion

Recent Posts

Bau-Spezialist Schöck: Migration von SAP ECC ERP auf S/4HANA

Bau- und Fertigungsspezialist investiert in die S/4HANA-Migration und geht mit RISE WITH SAP in die…

3 Stunden ago

Pure Storage: Cloud, KI und Energieeffizienz

Trends 2025: Rasante Entwicklungen bei Automatisierung, KI und in vielen anderen Bereichen lassen Unternehmen nicht…

1 Tag ago

GenKI verbessert Datenmanagement und Angebotsgenauigkeit

DHL Supply Chain nutzt generative KI-Anwendungen für Datenbereinigung und präzisere Beantwortung von Angebotsanforderungen (RFQ).

2 Tagen ago

Rolls-Royce Power Systems nutzt industrielle KI aus der IFS Cloud​

Marke mtu will globale Serviceabläufe optimieren und strategische Ziele hinsichtlich Effizienz, Nachhaltigkeit und Wachstum unterstützen.

2 Tagen ago

Thomas-Krenn.AG: viele Pflichten, knappe Ressourcen, mehr freie IT-Welt

IT-Infrastruktur-Trends 2025: Open-Source-Projekte sowie aufwändige regulatorische und Pflichtaufgaben werden das Jahr prägen.

2 Tagen ago

Stadt Kempen nutzt Onsite Colocation-Lösung

IT-Systeme werden vor Ort in einem hochsicheren IT-Safe betrieben, ohne auf bauliche Maßnahmen wie die…

3 Tagen ago