Анализ данных с помощью современного Apache Spark
8-дневный (32 часовой) курс обучения по использованию распределенной платформы Apache Spark для работы с большими массивами данных, в том числе — неструктурированных и потоковой обработки информации.
Вы пройдете путь от основ архитектуры Spark до работы с продвинутыми компонентами, такими как GraphX, ML, Structured Streaming и Delta Lake. Программа охватывает как классические подходы (RDD, DataFrames, Spark SQL), так и актуальные тренды: интеграцию с Kubernetes, pandas API в Spark и управление данными через Delta Lake.
Подробная программа https://bigdataschool.ru/courses/apache-spark-sql
Event at a glance
- Who it is for
- data engineers, data scientists, big data developers, analysts
- Main topics
- Apache Spark, big data processing, data engineering
- What you will gain
- understand Spark architecture, work with RDDs, DataFrames, Spark SQL, implement structured streaming, use GraphX and MLlib, integrate Spark with Kubernetes and Delta Lake
- Program format
- course, hands-on, deep technical