Методы балансировки и нормализации данных для улучшения качества классификации.
Ключевые слова:
машинное обучение, анализ данных, нейронные сети, однородное ансамблирование, несбалансированность данных, распознавание образов, метод опорных векторовАннотация
Очень часто непосредственное использование стандартных моделей приводит к результатам низкого качества. В статье рассмотрены два примера. Первый пример касается классификации популярных данных «Credit», полученных с платформы Kaggle. В качестве классификатора мы используем стандартную функцию nnet (нейронные сети) в программной среде R. Проблема состоит в том, что данные «Credit» являются несбалансированными, а функция nnet склонна игнорировать класс, который составляет меньшинство. В качестве решения проблемы несбалансированности мы предлагаем рассмотреть большое число относительно небольших и сбалансированных подмножеств, в которых элементы из тренировочной базы данных отбираются случайным образом. Второй пример касается широкоизвестных данных MNIST при использовании стандартной функции svm (метод опорных векторов) в среде Python. Показана необходимость нормализации исходных признаков.
Загрузки
Опубликован
Выпуск
Раздел
Лицензия
Материал публикуется под лицензией:

