Методы балансировки и нормализации данных для улучшения качества классификации.
Ключевые слова:
машинное обучение, анализ данных, нейронные сети, однородное ансамблирование, несбалансированность данных, распознавание образов, метод опорных векторовАннотация
Очень часто непосредственное использование стандартных моделей приводит к результатам низкого качества. В статье рассмотрены два примера. Первый пример касается классификации популярных данных «Credit», полученных с платформы Kaggle. В качестве классификатора мы используем стандартную функцию nnet (нейронные сети) в программной среде R. Проблема состоит в том, что данные «Credit» являются несбалансированными, а функция nnet склонна игнорировать класс, который составляет меньшинство. В качестве решения проблемы несбалансированности мы предлагаем рассмотреть большое число относительно небольших и сбалансированных подмножеств, в которых элементы из тренировочной базы данных отбираются случайным образом. Второй пример касается широкоизвестных данных MNIST при использовании стандартной функции svm (метод опорных векторов) в среде Python. Показана необходимость нормализации исходных признаков.
Загрузки
Опубликован
Выпуск
Раздел
Лицензия
Copyright (c) 2017 Владимир Николаевич Никулин, Илья Сергеевич Канищев, Иван Владимирович Багаев

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.
