Исходный размер 1140x1600

Анализ фильмов и сериалов Netflix

PROTECT STATUS: not protected

Концепция

Я выбрала для анализа датасет Netflix Movies and TV Shows, так как всегда любила смотреть сериалы и фильмы на Netflix. Мне интересно, какие жанры самые популярные, как меняются тренды во времени, и какие страны производят больше всего контента. Исследование этих данных позволяет лучше понять глобальные тенденции в индустрии развлечений и выявить закономерности, которые не всегда заметны на первый взгляд.

big
Исходный размер 3168x1344

Датасет был взят с платформы Kaggle и содержит информацию о более чем 8 000 фильмах и сериалах Netflix. Он включает такие характеристики, как названия, жанры, страны производства, даты релиза и добавления на платформу, продолжительность, возрастной рейтинг и ключевых актёров.

big
Исходный размер 3168x1344

Для визуализации данных я выбрала различные виды графиков, которые помогают наглядно отразить структуру и тенденции контента Netflix:

Круговая диаграмма — показывает соотношение фильмов и сериалов на платформе; Гистограмма — демонстрирует распределение контента по годам выпуска; Точечная диаграмма — отражает зависимость длительности фильмов от года выпуска; Тепловая карта — подчеркивает популярность жанров по десятилетиям; Облако слов — показывает актёров, наиболее часто встречающихся в контенте Netflix; Диаграмма размаха — позволяет сравнить распределение длительности фильмов по возрастному рейтингу; Линейные графики — демонстрируют среднее количество сезонов сериалов по годам.

Использование этих визуализаций позволяет одновременно показать динамику изменений во времени, выявить популярные жанры и страны-производители, а также понять, как развивался контент Netflix на протяжении последних десятилетий.

Исходный размер 3168x1344

Загрузка и обработка данных

Исходный размер 3500x848

установка и импорт библиотек и файла

Для начала я импортировала необходимые библиотеки: pandas и numpy для работы с таблицами и числовыми данными, matplotlib.pyplot для визуализации и wordcloud для создания облака слов. После чего считала CSV-файл с данными Netflix Movies and TV Shows.

После загрузки данных я провела первичный анализ: проверила типы данных и количество пропусков в каждой колонке. Это помогло понять, какие колонки нуждаются в обработке, а какие можно использовать сразу для визуализации.

Исходный размер 3500x217

первичный анализ данных

Далее я обработала дату добавления контента на платформу. Колонка date_added была преобразована в формат datetime, а на её основе созданы отдельные колонки с годом и месяцем добавления. Эти данные пригодятся для анализа динамики появления новых фильмов и сериалов.

Исходный размер 3500x285

обработка дат

Следующим шагом я обработала колонку duration, которая содержит информацию о продолжительности фильмов (в минутах) или сезонов сериалов. Для этого написала функцию parse_duration, которая разделяет числовое значение и единицу измерения.

Исходный размер 3500x521

обработка длительности контента

Чтобы анализировать тренды по времени, я создала колонку decade, отражающую десятилетие выпуска контента. Также было необходимо преобразовать колонки, содержащие несколько значений через запятую — такие как country, listed_in (жанры) и cast (актеры). Для этого я использовала функцию explode_column, которая разбивает такие строки на отдельные элементы.

Исходный размер 3500x702

десятилетия и разбиение колонок

Для удобства анализа я перевела названия стран и жанров на русский язык с помощью словарей country_translation и genre_translation. Также создала колонку genre_ru с русскими названиями жанров. Это необходимо для того, чтобы визуализации были понятны русскоязычной аудитории.

Исходный размер 3500x2064

перевод стран и жанров

Наконец, я подготовила отдельные датасеты для фильмов и сериалов. Для фильмов создала колонку с русским возрастным рейтингом (rating_ru) и сохранила топ рейтингов. Для сериалов извлекла количество сезонов и рассчитала среднее количество сезонов по годам, включая скользящее среднее для сглаживания тренда.

Исходный размер 3500x1379

подготовка данных для фильмов и рейтингов

Исходный размер 3500x255

обработка данных для сериалов

Исходный размер 3168x1344

Стилизация

Для того чтобы визуализации выглядели аккуратно и были единообразными, я настроила стиль графиков в matplotlib. Основная цель — сделать графики читаемыми и приятными для восприятия, с контрастной цветовой схемой, подходящей под тему Netflix.

Исходный размер 3500x1460

В качестве шрифта я подключила Onest, чтобы тексты на графиках выглядели современно и гармонировали с общей стилистикой проекта. Кроме того, была установлена тёмная тема для фона графиков и белый цвет текста, что делает визуализации контрастабельными и лёгкими для восприятия.

Также я определила фирменные цвета Netflix: NETFLIX_RED — основной красный цвет, использованный для акцентов и ключевых элементов; NETFLIX_GRAY — серый цвет для второстепенных элементов.

Исходный размер 3500x1302

Визуализация данных

0

круговая диаграмма соотношение фильмов и сериалов на Netflix

Анализ фильмов и сериалов Netflix
Проект создан 17.01.2026
Мы используем файлы cookies для улучшения работы сайта и большего удобства его использования. Более подробную информац...
Показать больше