Предсказание оттока абонентов: сравнение методов машинного обучения

Авторы

  • Святослав Александрович Арзамасцев Санкт-Петербургский государственный университет, Санкт-Петербург, Россия
  • Михаил Владимирович Бгатов Санкт-Петербургский государственный университет, Санкт-Петербург, Россия
  • Елена Николаевна Картышева Санкт-Петербургский государственный университет, Санкт-Петербург, Россия
  • Виктор Артурович Деркунский Санкт-Петербургский государственный университет, Санкт-Петербург, Россия
  • Дмитрий Николаевич Семенчиков Санкт-Петербургский государственный университет, Санкт-Петербург, Россия

DOI:

https://doi.org/10.32603/2071-2340-2018-3-5-23

Ключевые слова:

анализ данных, машинное обучение, балансировка данных, обработка данных, ансамбли моделей.

Аннотация

Чтобы оставаться конкурентноспособным сегодня в телекоммуникационном бизнесе, необходимо определять клиентов, которые недовольны предоставляемыми услугами, поэтому прогнозирование оттока стало актуальной проблемой в данной сфере. В этой статье рассмотрены основные современные алгоритмы машинного обучения, которые применялись для решения этой задачи, включая дерево принятия решений (DT — Decision Trees), наивный байесовский классификатор (NB — Naive Bayes Classifier), случайный лес (RF — Random Forest), искусственные нейронные сети (NN — Artificial Neural Network), метод k-ближайших соседей (KNN — K-Nearest Neighbors), линейный дискриминантный анализ (LDA — Linear Discriminant Analysis), метод опорных векторов (SVM — Support Vector Machine) и их ансамблирование (бэггинг и бустинг) с целью продемонстрировать превосходство новой технологии CatBoost в мерах эффективности классификаторов. Для достижения цели была проведена классификация данных и выявлены конкретные преимущества метода CatBoost в сравнении с другими на основе полученных результатов. Для проведения исследования нами были проанализированы четыре базы данных: 3 датасета находятся в открытом доступе и 1 датасет, предоставленный российской мобильной компанией. Зачастую размерность этих баз данных высока, что приводит к ряду проблем (в том числе несбалансированности классов, корреляции параметров), которые решаются методом уменьшения размерности: метод главных компонент (PCA — Principal Component Analysis). Полученные результаты сравниваются между собой, а также с результатами, представленными другими исследователями на основе открытых баз данных. Эффективность классификаторов оценивается с помощью таких мер, как площадь под кривой (AUC), точность, F1-мера и время.

Биографии авторов

  • Святослав Александрович Арзамасцев, Санкт-Петербургский государственный университет, Санкт-Петербург, Россия

    Арзамасцев Святослав Александрович, cтудент кафедры статистического моделирования математикомеханического факультета СПбГУ; 198504 Санкт-Петербург, Петергоф, Университетский пр., 28, каб. 4399, st037590@student.spbu.ru

  • Михаил Владимирович Бгатов, Санкт-Петербургский государственный университет, Санкт-Петербург, Россия

    Бгатов Михаил Владимирович, cтудент математико-механического факультета СПбГУ, st047070@student.spbu.ru

  • Елена Николаевна Картышева, Санкт-Петербургский государственный университет, Санкт-Петербург, Россия

    Картышева Елена Николаевна, cтудентка математико-механического факультета СПбГУ, st048188@student.spbu.ru

  • Виктор Артурович Деркунский, Санкт-Петербургский государственный университет, Санкт-Петербург, Россия

    Деркунский Виктор Артурович, cтудент математико-механического факультета СПбГУ, st047728@student.spbu.ru

  • Дмитрий Николаевич Семенчиков, Санкт-Петербургский государственный университет, Санкт-Петербург, Россия

    Семенчиков Дмитрий Николаевич, aспирант факультета прикладной математики — процессов управления СПбГУ, st016311@student.spbu.ru

Загрузки

Опубликован

30.10.2018

Выпуск

Раздел

Инженерия программного обеспечения

Как цитировать

[1]
С. А. Арзамасцев, М. В. Бгатов, Е. Н. Картышева, В. А. Деркунский, и Д. Н. Семенчиков, «Предсказание оттока абонентов: сравнение методов машинного обучения», Компьютерные инструменты в образовании, вып. 5, сс. 5–23, окт. 2018, doi: 10.32603/2071-2340-2018-3-5-23.

Похожие статьи

1-10 из 348

Вы также можете начать расширеннвй поиск похожих статей для этой статьи.