Объяснение SMOTE: алгоритм интерполяции kNN, лежащий в основе синтетической передискретизации Быстрый ответ (40–100 слов): SMOTE (техника избыточной выборки синтетического меньшинства) исправляет дисбаланс классов за счет синтеза новых примеров меньшинства вместо копирования ...
Объяснение SMOTE: алгоритм интерполяции kNN, лежащий в основе синтетической передискретизации
Быстрый ответ (40–100 слов): SMOTE (техника избыточной выборки синтетического меньшинства) устраняет дисбаланс классов путем синтеза новых примеров меньшинства, а не их копирования. Для каждой точки меньшинства он находит k ближайших соседей меньшинства и создает синтетическую точку на отрезке линии между точкой и случайно выбранным соседом со случайным коэффициентом интерполяции ∈ [0,1]. Это находится в функции _make_samples из BaseSMOTE для несбалансированного обучения. Он превосходит наивную случайную передискретизацию, поскольку расширяет границу решения в направлении реального меньшинства, а не запоминает дубликаты.
Отказ от ответственности: Шакти Тивари сертифицирована NISM-Series-XII; не зарегистрированный в SEBI аналитик-исследователь. Контент носит исключительно образовательный характер.
Почему это важно
Несбалансированные наборы данных — тихий убийца ванильных классификаторов. Если 99% ваших ОТЛИЧНЫХ 5-минутных баров представляют собой «нет большого движения», а 1% — «большое движение», то модель, которая каждый раз предсказывает «нет движения», имеет точность 99% и бесполезна для торговли. Точность вранье. Вам нужен класс меньшинства (редкое событие, требующее большого количества информации), чтобы его можно было изучить.
Существуют два простых решения: (1) занижать выборку большинства (выбрасывать