当前位置：首页 > news >正文

【Python】使用SMOTE解决数据不平衡问题

news 2025/8/1 22:58:29

原谅把你带走的雨天
在渐渐模糊的窗前
每个人最后都要说再见
原谅被你带走的永远
微笑着容易过一天
也许是我已经老了一点
那些日子你会不会舍不得
思念就像关不紧的门
空气里有幸福的灰尘
否则为何闭上眼睛的时候
又全都想起了
谁都别说
让我一个人躲一躲
你的承诺
我竟然没怀疑过
反反覆覆
要不是当初深深深爱过
我试着恨你
却想起你的笑容
🎵 陈楚生/单依纯《原谅》

在机器学习和数据科学领域，不平衡数据集是一个常见的问题。数据不平衡会导致模型偏向于预测多数类，从而影响分类器的性能。为了应对这一挑战，研究人员提出了许多方法，其中SMOTE（Synthetic Minority Over-sampling Technique）是最常用的方法之一。本文将介绍如何使用imblearn库中的SMOTE来处理不平衡数据集。

什么是SMOTE？

SMOTE是一种过采样技术，通过生成合成的少数类样本来平衡数据集。其基本思想是基于少数类样本的特征向量，在其特征空间中进行插值，生成新的合成样本。SMOTE可以有效地减少因数据不平衡导致的模型偏差，提高分类器的性能。

安装Imbalanced-learn库

在使用SMOTE之前，我们需要安装imbalanced-learn库，这是一个专门用于处理不平衡数据集的Python库。可以使用以下命令进行安装：

pip install imbalanced-learn

基本用法

假设我们有一个不平衡的数据集，其中少数类样本较少。我们将使用SMOTE对其进行处理。以下是一个简单的示例：

import pandas as pd
from sklearn.datasets import make_classification
from sklearn.model_selection import train_test_split
from imblearn.over_sampling import SMOTE
from collections import Counter# 生成一个不平衡的数据集
X, y = make_classification(n_samples=1000, n_features=20, n_informative=2, n_redundant=10, n_clusters_per_class=1, weights=[0.9, 0.1], flip_y=0, random_state=42)# 查看数据分布
print(f"原始数据集类别分布: {Counter(y)}")# 划分训练集和测试集
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42, stratify=y)# 使用SMOTE进行过采样
smote = SMOTE(random_state=42)
X_resampled, y_resampled = smote.fit_resample(X_train, y_train)# 查看过采样后的数据分布
print(f"过采样后数据集类别分布: {Counter(y_resampled)}")

代码详解

数据生成：

我们使用make_classification函数生成一个不平衡的数据集。该数据集有1000个样本，20个特征，其中90%的样本属于多数类（类0），10%的样本属于少数类（类1）。

X, y = make_classification(n_samples=1000, n_features=20, n_informative=2, n_redundant=10, n_clusters_per_class=1, weights=[0.9, 0.1], flip_y=0, random_state=42)

数据分布：

使用Counter查看原始数据集的类别分布，确认数据集不平衡。

print(f"原始数据集类别分布: {Counter(y)}")

数据集划分：

将数据集划分为训练集和测试集，并保持数据分布的一致性。

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42, stratify=y)

SMOTE过采样：

使用SMOTE对训练集进行过采样，以平衡少数类和多数类样本的数量。

smote = SMOTE(random_state=42)
X_resampled, y_resampled = smote.fit_resample(X_train, y_train)

查看过采样后的数据分布：

再次使用Counter查看过采样后的数据分布，确认数据集已经平衡。

print(f"过采样后数据集类别分布: {Counter(y_resampled)}")

SMOTE的优点和局限性

优点：

提高模型性能：通过平衡数据集，SMOTE可以显著提高分类器的性能，特别是在处理不平衡数据时。
易于实现：使用imbalanced-learn库中的SMOTE非常简单，只需几行代码即可完成过采样。
灵活性：SMOTE可以与其他预处理方法和机器学习算法结合使用，具有很高的灵活性。
局限性：
可能引入噪声：由于SMOTE是基于插值的方法生成合成样本，可能会引入一些噪声数据，影响模型的性能。
不适用于高维数据：在高维数据中，生成合成样本的插值过程可能会变得不稳定，影响过采样效果。
无法处理极端不平衡：对于极端不平衡的数据集，SMOTE的效果可能不如其他高级方法（如ADASYN、Borderline-SMOTE等）。

总结

SMOTE是一种强大的过采样技术，可以有效地处理不平衡数据集，提升分类器的性能。通过imbalanced-learn库中的SMOTE实现，我们可以轻松地对少数类样本进行过采样，平衡数据集。在实际应用中，我们可以根据具体数据集的特点和需求，选择合适的过采样方法。

查看全文

http://www.lryc.cn/news/354184.html

Redis第18讲——Redis和Redission实现延迟消息

返回枚举类给前端

A. Maximize?

RBAC 动态权限

c语言：模拟strlen（三种方法）最全版本

线性模型--普通最小二乘法

移动云以深度融合之服务，令“大”智慧贯穿云端

簡述vue常用指令

【建议收藏】用AI快速生成一个网页（名侦探柯南~灰原哀主题网页），适合大学生web期末大作业

用c++用4个凸函数（觉得啥好用用啥）去测试adam，rmsprop，adagrad算法的性能（谁先找到最优点）

Linux系统命令traceroute详解（语法、选项、原理和实例）

中兴通讯助力中国移动，推动SPN AI节能技术于23省规模部署

SQL Server--死锁

中科蓝讯AB32VG1中文寄存器说明GPIO端口操作

如何查看热门GPT应用？

C++中的各种定义

Java面向对象-常用类（日期时间类）

Shell环境变量深入：自定义系统环境变量

【C++课程学习】：命名空间的理解（图文详解）

鸿蒙ArkUI-X平台差异化：【运行态差异化(@ohos.deviceInfo)】

蓝牙Mesh模块组网时无线回程影响速率吗？

将3D检测的box框投影到BEV图片上

Flutter 中的 ClipOval 小部件：全面指南

ubuntu 硬盘转移

three.js中使用CameraHelper来可视化调整阴影相机的范围

什么是SMOTE？

安装Imbalanced-learn库

基本用法

代码详解

SMOTE的优点和局限性

总结

相关文章：