Aplikacje

Cloudera i NVIDIA współpracują nad obniżeniem kosztów obliczeń w chmurze i przyspieszeniem Apache Spark

Cloudera, jedyna firma, wprowadzająca sztuczną inteligencję do danych niezależnie od ich lokalizacji, wprowadziła rozwiązanie zwiększające wydajność Apache Spark 4.1. Dzięki wykorzystaniu procesorów GPU NVIDIA w środowisku Cloudera Data Engineering użytkownicy mogą szybciej przetwarzać dane i przygotowywać je do zastosowań AI. Wtyczka NVIDIA cuDF dla Apache Spark będzie współpracować również z Cloudera Anywhere Cloud™, umożliwiając usprawnienie procesów realizowanych z wykorzystaniem Spark bez konieczności modyfikowania istniejącego kodu w PySpark czy SQL. Usprawni to przygotowywanie danych do zastosowań AI, a jednocześnie ograniczy koszty infrastruktury chmurowej w środowiskach hybrydowych.

 

Wspólne rozwiązanie zapewni:

  • Przyspieszenie procesów Apache Spark 4.1 bez konieczności modyfikowania kodu
  • Szybsze procesy ETL i przygotowywanie danych na potrzeby analiz i zastosowań AI
  • Niższe koszty infrastruktury chmurowej dzięki skróceniu czasu wykonywania obliczeń
  • Automatyczne wdrażanie bez konieczności ręcznej konfiguracji sterowników
  • Bezpieczeństwo i mechanizmy zarządzania danymi klasy enterprise dzięki Cloudera Unified Data Fabric
  • Spójną wydajność w środowiskach chmury publicznej, prywatnej i suwerennej oraz infrastrukturze lokalnej (on-premises)

 

Wraz z rozwojem inicjatyw związanych ze sztuczną inteligencją coraz większym wyzwaniem dla organizacji staje się szybkie przygotowywanie danych. Ich przetwarzanie na dużą skalę z wykorzystaniem Apache Spark może trwać wiele godzin, co opóźnia analizy oraz wdrażanie zastosowań AI, a jednocześnie zwiększa koszty obliczeń w chmurze. Zastosowanie procesorów GPU bezpośrednio w środowisku Cloudera Data Engineering znacząco skraca czas realizacji procesów opartych na Spark, a równocześnie umożliwia korzystanie z dotychczasowych aplikacji Spark bez konieczności modyfikowania kodu czy zmiany sposobu pracy.

 

Przyspieszenie Apache Spark na potrzeby AI

Apache Spark jest wykorzystywany w wielu procesach przetwarzania danych stosowanych dziś przez przedsiębiorstwa. Dzięki natywnemu wykorzystaniu procesorów GPU w środowisku Cloudera Data Engineering firmy mogą zwiększyć wydajność przetwarzania danych, zachowując jednocześnie poziom bezpieczeństwa i mechanizmy zarządzania wymagane w środowiskach produkcyjnych. Wykorzystując bibliotekę NVIDIA cuDF do obsługi procesów realizowanych w Spark, Cloudera zapewni do 4-krotnie wyższą wydajność na procesorach GPU NVIDIA w porównaniu z tradycyjną infrastrukturą opartą na CPU. Pozwoli to znacząco skrócić czas potrzebny na przetwarzanie danych.

W przeciwieństwie do rozwiązań wykorzystujących GPU, które są dostępne wyłącznie w ramach jednej chmury publicznej, Cloudera rozszerza ich zastosowanie na różne środowiska hybrydowe, przy zachowaniu spójnych zasad zarządzania danymi i procesów operacyjnych. Firmy mogą przyspieszać procesy realizowane w Apache Spark niezależnie od tego, gdzie znajdują się ich dane – w infrastrukturze lokalnej, chmurze czy na brzegu sieci (edge) – bez kompromisów w zakresie bezpieczeństwa i elastyczności.

 

Szybsze procesy przetwarzania danych, niższe koszty infrastruktury

Szybkie przygotowywanie wiarygodnych danych przy jednoczesnym utrzymaniu kosztów na racjonalnym poziomie ma kluczowe znaczenie dla analiz i zastosowań AI. Z najnowszego badania Cloudera The Great Re-Architecture Survey wynika, że zdecydowana większość respondentów (84%) wskazuje na wzrost kosztów infrastruktury związany z obsługą obciążeń AI. Dzięki przyspieszeniu procesów realizowanych w Apache Spark organizacje mogą szybciej przygotowywać dane do wykorzystania przez modele AI, ograniczając koszty infrastruktury i jednocześnie zwiększając produktywność zespołów odpowiedzialnych za inżynierię danych, AI i analitykę.

 

– W przypadku wielu organizacji ograniczeniem w wykorzystaniu AI nie są same modele, lecz tempo, w jakim surowe dane można przekształcić w wiarygodne i użyteczne informacje – mówi Leo Brunnick, Chief Product Officer w Cloudera. Przyspieszenie procesów Apache Spark w środowisku Cloudera Data Engineering pozwala usunąć tę barierę, dzięki czemu organizacje mogą szybciej przechodzić od przygotowania danych do ich analizy i wykorzystania w zastosowaniach AI, zachowując jednocześnie bezpieczeństwo, kontrolę nad danymi i spójność procesów operacyjnych – dodaje Brunnick.

– Najszybszym sposobem na przyspieszenie wdrażania AI jest rozwiązanie, które wpisuje się w sposób, w jaki przedsiębiorstwa już dziś prowadzą swoje procesy. Dzięki natywnemu wykorzystaniu infrastruktury AI NVIDIA i bibliotek CUDA-X w środowisku Cloudera Data Engineering przedsiębiorstwa mogą obniżyć koszty i znacząco przyspieszyć procesy Apache Spark bez konieczności modyfikowania choćby jednej linii kodu w PySpark czy SQL. W efekcie dane biznesowe mogą szybciej stać się podstawą do rozwoju zastosowań AI – komentuje Pat Lee, Vice President, Strategic Enterprise Partnerships w NVIDIA.

 

Możliwość wykorzystania procesorów GPU do przyspieszenia Apache Spark będzie dostępna w Cloudera Data Engineering jako część rozwiązania Cloudera Anywhere Cloud™. Dodatkowe prezentacje i sesje techniczne poświęcone rozwiązaniu odbędą się jeszcze w tym roku podczas NVIDIA GTC Berlin oraz Cloudera EVOLVE New York.

Więcej informacji można znaleźć na stronie Cloudera.com lub podczas nadchodzących konferencji EVOLVE, na których organizacje będą mogły dowiedzieć się, jak przyspieszać procesy związane z inżynierią danych i AI w środowiskach hybrydowych.

Dodaj komentarz

Ta strona używa Akismet do redukcji spamu. Dowiedz się, w jaki sposób przetwarzane są dane Twoich komentarzy.