Анализ данных с помощью современного Apache Spark

8-дневный (32 часовой) курс обучения по использованию распределенной платформы Apache Spark для работы с большими массивами данных, в том числе — неструктурированных и потоковой обработки информации.

Вы пройдете путь от основ архитектуры Spark до работы с продвинутыми компонентами, такими как GraphX, ML, Structured Streaming и Delta Lake. Программа охватывает как классические подходы (RDD, DataFrames, Spark SQL), так и актуальные тренды: интеграцию с Kubernetes, pandas API в Spark и управление данными через Delta Lake.

Подробная программа https://bigdataschool.ru/courses/apache-spark-sql

Теги:

Event at a glance

Who it is for
data engineers, data scientists, big data developers, analysts
Main topics
Apache Spark, big data processing, data engineering
What you will gain
understand Spark architecture, work with RDDs, DataFrames, Spark SQL, implement structured streaming, use GraphX and MLlib, integrate Spark with Kubernetes and Delta Lake
Program format
course, hands-on, deep technical