Python如何实现类别变量的独热编码(python,开发技术)

Python如何实现类别变量的独热编码

导读：本文共3530字符，通常情况下阅读需要12分钟。同时您也可以点击右侧朗读，来听本文内容。按键盘←（左） →（右）方向键可以翻页。

摘要：在数据处理与分析领域，对数值型与字符型类别变量加以编码是不可或缺的预处理操作；这里介绍两种不同的方法。1 OneHotEncoder首先导入必要的模块。importpandasaspdfromsklearn.preprocessingimportOneHotEncoder其中，OneHotEncoder是我们实现独热编码的关键模块。接下来，导入并显示数据前五行... ...

音频解说

可以发现，一共有三个array，为什么呢？仔细看可以发现，独热编码是将我们导入的三列数据全部都当作类别变量来处理了。之所以会这样，是因为我们在一开始没有表明哪一列是类别变量，需要进行独热编码；而哪一列不是类别变量，从而不需要进行独热编码。

那么，我们如何实现上述需求，告诉程序我们要对哪一行进行独热编码呢？在老版本的sklearn中，我们可以借助categorical_features=[x]参数来实现这一功能，但是新版本sklearn取消了这一参数。那么此时，一方面，我们可以借助ColumnTransformer来实现这一过程，另一方面，我们可以直接对需要进行转换的列加以处理。后者相对较为容易理解，因此本文对后者进行讲解。

我们将test_data_1中的'SoilType'列作为索引，从而仅仅对该列数据加以独热编码。

ohe_column=pd.DataFrame(ohe.fit_transform(test_data_1[['SoilType']]).toarray())ohe_column.head(5)

其中，[['SoilType']]表示仅仅对这一列进行处理。得到结果如下图。

Python如何实现类别变量的独热编码

可以看到，原来的'SoilType'列现在成为了63列的编码列，那么这样的话，说明我们原先的'SoilType'应该一共是有63个不同的数值。是不是这个样子呢？我们来检查一下。

count=pd.DataFrame(test_data_1['SoilType'].value_counts())print(count)

得到结果如下。

Python如何实现类别变量的独热编码

好的，没有问题：可以看到此结果共有63行，也就是'SoilType'列原本是有63个不同的值的，证明我们的独热编码没有出错。

此时看一下我们的test_data_1数据目前长什么样子。

test_data_1.head(5)

Python如何实现类别变量的独热编码

是的，我们仅仅对'SoilType'列做了处理，没有影响到整个初始数据。那么先将原本的'SoilType'列剔除掉。

test_data_1=test_data_1.drop(['SoilType'],axis=1)test_data_1.head(5)

Python如何实现类别变量的独热编码

再将经过独热编码处理后的63列加上。

test_data_1.join(ohe_column)

Python如何实现类别变量的独热编码

大功告成！

但是这里还有一个问题，我们经过独热编码所得的列名称是以数字来命名的，非常不方便。因此，有没有什么办法可以在独热编码进行的同时，自动对新生成的列加以重命名呢？

2 pd.get_dummies

pd.get_dummies是一个最好的办法！其具体用法与上述OneHotEncoder类似，因此具体过程就不再赘述啦，大家看代码就可以明白。

首先还是导入与上述内容中一致的初始数据。

test_data_2=pd.read_csv('G:/CropYield/03_DL/00_Data/onehot_test.csv',names=['EVI0610','EVI0626','SoilType'],header=0)test_data_2.head(5)

Python如何实现类别变量的独热编码

进行独热编码并看看结果。

test_data_2_ohe=pd.get_dummies(test_data_2,columns=['SoilType'])test_data_2_ohe.head(5)

Python如何实现类别变量的独热编码

最终结果中，列名称可以说是非常醒目，同时，共有65列数据，自动删除了原本的'SoilType'列，实现了“独热编码”“新列重命名”与“原始列删除”，可谓一举三得，简直是太方便啦~

 </div> <div class="zixun-tj-product adv-bottom"></div> </div> </div> <div class="prve-next-news">

本文：Python如何实现类别变量的独热编码的详细内容，希望对您有所帮助，信息来源于网络。

Python如何实现类别变量的独热编码(python,开发技术)

目录

1 OneHotEncoder

2 pd.get_dummies

4 人围观 / 0 条评论 ↓快速评论↓

搜索

最新文章

猜你喜欢

特价优惠

标签

流量统计