Анализ данных с помощью современного Apache Spark

8-дневный (32 часовой) курс обучения по использованию распределенной платформы Apache Spark для работы с большими массивами данных, в том числе — неструктурированных и потоковой обработки информации.

Вы пройдете путь от основ архитектуры Spark до работы с продвинутыми компонентами, такими как GraphX, ML, Structured Streaming и Delta Lake. Программа охватывает как классические подходы (RDD, DataFrames, Spark SQL), так и актуальные тренды: интеграцию с Kubernetes, pandas API в Spark и управление данными через Delta Lake.

Подробная программа https://bigdataschool.ru/courses/apache-spark-sql

Теги:

Кратко о мероприятии

Для кого
инженеры данных, дата-сайентисты, разработчики больших данных, аналитики
Основные темы
Apache Spark, обработка больших данных, инженерия данных
Что получите
понять архитектуру Spark, работать с RDD, DataFrame, Spark SQL, реализовать структурированную потоковую обработку, использовать GraphX и MLlib, интегрировать Spark с Kubernetes и Delta Lake
Формат программы
курс, практические занятия, глубокий технический