当前位置：Gxlcms > Python > Python对多属性的重复数据去重

Python对多属性的重复数据去重

时间：2021-07-01 10:21:17 帮助过：9人阅读

下面为大家分享一篇Python对多属性的重复数据去重实例，具有很好的参考价值，希望对大家有所帮助。一起过来看看吧

python中的pandas模块中对重复数据去重步骤：

1）利用DataFrame中的duplicated方法返回一个布尔型的Series,显示各行是否有重复行，没有重复行显示为FALSE，有重复行显示为TRUE；

2）再利用DataFrame中的drop_duplicates方法用于返回一个移除了重复行的DataFrame。

注释：

如果duplicated方法和drop_duplicates方法中没有设置参数，则这两个方法默认会判断全部咧，如果在这两个方法中加入了指定的属性名（或者称为列名），例如：frame.drop_duplicates(['state']),则指定部分列（state列）进行重复项的判断。

具体实例如下：

>>> import pandas as pd 
>>> data={'state':[1,1,2,2],'pop':['a','b','c','d']} 
>>> frame=pd.DataFrame(data) 
>>> frame 
 pop state 
0 a  1 
1 b  1 
2 c  2 
3 d  2 
>>> IsDuplicated=frame.duplicated() 
>>> print IsDuplicated 
0 False 
1 False 
2 False 
3 False 
dtype: bool 
>>> frame=frame.drop_duplicates(['state']) 
>>> frame 
 pop state 
0 a  1 
2 c  2 
>>> IsDuplicated=frame.duplicated(['state']) 
>>> print IsDuplicated 
0 False 
2 False 
dtype: bool 
>>>

以上就是Python对多属性的重复数据去重的详细内容，更多请关注Gxl网其它相关文章！

Python对多属性的重复数据去重

人气教程排行