当前位置：首页 > news >正文

pandas 筛选数据的 8 个骚操作

news 2026/5/14 1:37:43

日常用Python做数据分析最常用到的就是查询筛选了，按各种条件、各种维度以及组合挑出我们想要的数据，以方便我们分析挖掘。

东哥总结了日常查询和筛选常用的种骚操作，供各位学习参考。本文采用sklearn的boston数据举例介绍。

from sklearn import datasets
import pandas as pdboston = datasets.load_boston()
df = pd.DataFrame(boston.data, columns=boston.feature_names)

1. []

第一种是最快捷方便的，直接在dataframe的[]中写筛选的条件或者组合条件。比如下面，想要筛选出大于NOX这变量平均值的所有数据，然后按NOX降序排序。

df[df['NOX']>df['NOX'].mean()].sort_values(by='NOX',ascending=False).head()

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

当然，也可以使用组合条件，条件之间使用逻辑符号& |等。比如下面这个例子除了上面条件外再加上且条件CHAS为1，注意逻辑符号分开的条件要用()隔开。

df[(df['NOX']>df['NOX'].mean())& (df['CHAS'] ==1)].sort_values(by='NOX',ascending=False).head()

2. loc/iloc

除[]之外，loc/iloc应该是最常用的两种查询方法了。loc按标签值（列名和行索引取值）访问，iloc按数字索引访问，均支持单值访问或切片查询。除了可以像[]按条件筛选数据以外，loc还可以指定返回的列变量，从行和列两个维度筛选。

比如下面这个例子，按条件筛选出数据，并筛选出指定变量，然后赋值。

df.loc[(df['NOX']>df['NOX'].mean()),['CHAS']] = 2

3. isin

上面我们筛选条件< > == !=都是个范围，但很多时候是需要锁定某些具体的值的，这时候就需要isin了。比如我们要限定NOX取值只能为0.538,0.713,0.437中时。

df.loc[df['NOX'].isin([0.538,0.713,0.437]),:].sample(5)

当然，也可以做取反操作，在筛选条件前加~符号即可。

df.loc[~df['NOX'].isin([0.538,0.713,0.437]),:].sample(5)

4. str.contains

上面的举例都是数值大小比较的筛选条件，除数值以外当然也有字符串的查询需求。pandas里实现字符串的模糊筛选，可以用.str.contains()来实现，有点像在SQL语句里用的是like。

下面利用titanic的数据举例，筛选出人名中包含Mrs或者Lily的数据，|或逻辑符号在引号内。

train.loc[train['Name'].str.contains('Mrs|Lily'),:].head()

.str.contains()中还可以设置正则化筛选逻辑。

case=True：使用case指定区分大小写
na=True：就表示把有NAN的转换为布尔值True
flags=re.IGNORECASE：标志传递到re模块，例如re.IGNORECASE
regex=True：regex ：如果为True，则假定第一个字符串是正则表达式，否则还是字符串

5. where/mask

在SQL里，我们知道where的功能是要把满足条件的筛选出来。pandas中where也是筛选，但用法稍有不同。

where接受的条件需要是布尔类型的，如果不满足匹配条件，就被赋值为默认的NaN或其他指定值。举例如下，将Sex为male当作筛选条件，cond就是一列布尔型的Series，非male的值就都被赋值为默认的NaN空值了。

cond = train['Sex'] == 'male'
train['Sex'].where(cond, inplace=True)
train.head()

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

也可以用other赋给指定值。

cond = train['Sex'] == 'male'
train['Sex'].where(cond, other='FEMALE', inplace=True)

甚至还可以写组合条件。

train['quality'] = ''
traincond1 = train['Sex'] == 'male'
cond2 = train['Age'] > 25train['quality'].where(cond1 & cond2, other='低质量男性', inplace=True)

mask和where是一对操作，与where正好反过来。

train['quality'].mask(cond1 & cond2, other='低质量男性', inplace=True)

6. query

这是一种非常优雅的筛选数据方式。所有的筛选操作都在''之内完成。

# 常用方式
train[train.Age > 25]
# query方式
train.query('Age > 25')

上面的两种方式效果上是一样的。再比如复杂点的，加入上面的str.contains用法的组合条件，注意条件里有''时，两边要用""包住。

train.query("Name.str.contains('William') & Age > 25")

在query里还可以通过@来设定变量。

name = 'William'
train.query("Name.str.contains(@name)")

7. filter

filter是另外一个独特的筛选功能。filter不筛选具体数据，而是筛选特定的行或列。它支持三种筛选方式：

items：固定列名
regex：正则表达式
like：以及模糊查询
axis：控制是行index或列columns的查询

下面举例介绍下。

train.filter(items=['Age', 'Sex'])

train.filter(regex='S', axis=1) # 列名包含S的

train.filter(like='2', axis=0) # 索引中有2的

train.filter(regex='^2', axis=0).filter(like='S', axis=1)

8. any/all

any方法意思是，如果至少有一个值为True结果便为True，all需要所有值为True结果才为True，比如下面这样。

>> train['Cabin'].all()
>> False
>> train['Cabin'].any()
>> True

any和all一般是需要和其它操作配合使用的，比如查看每列的空值情况。

train.isnull().any(axis=0)

再比如查看含有空值的行数。

>>> train.isnull().any(axis=1).sum()
>>> 708


`any`和`all`一般是需要和其它操作配合使用的，比如查看每列的空值情况。

train.isnull().any(axis=0)


[外链图片转存中...(img-QYyk6pc2-1694485667807)]再比如查看含有空值的行数。

train.isnull().any(axis=1).sum()
708

pandas 筛选数据的 8 个骚操作

1. []

2. loc/iloc

3. isin

4. str.contains

5. where/mask

6. query

7. filter

8. any/all

相关文章：

pandas 筛选数据的 8 个骚操作

【随想】每日两题Day.3（实则一题）

阿里后端开发：抽象建模经典案例【文末送书】

HarmonyOS Codelab 优秀样例——溪村小镇（ArkTS）

Mybatis---第二篇

6.2.3 【MySQL】InnoDB的B+树索引的注意事项

前端面试话术集锦第 12 篇：高频考点（Vue常考基础知识点）

骨传导耳机危害有哪些？值得入手吗？

网络爬虫-----初识爬虫

vue 功能：点击增加一项，点击减少一项

我的编程学习笔记

页面静态化、Freemarker入门

PCL （再探）点云配准精度评价指标——均方根误差

【Redis速通】基础知识1 - 虚拟机配置与踩坑

我的创作纪念日---从考研调剂到研一的旅程

Python-实现邮件发送：flask框架或django框架可以直接使用

使用亚马逊云科技Amazon SageMaker，为营销活动制作广告素材

conda环境安装opencv带cuda版本

R语言中的数据结构----矩阵

Llama-2 推理和微调的硬件要求总结：RTX 3080 就可以微调最小模型

终极指南：5分钟快速修复Windows更新问题的完整解决方案

网络安全AI智能体实战指南：从GPTs到高效安全运营

告别付费困扰：Linux与Windows双平台免费获取Typora全攻略

AI代理如何革新领导力评估：从隐藏档案任务到低成本高效测量

10个无状态服务构建技巧：解锁gh_mirrors/awe/awesome-sre中的水平扩展最佳实践

AI应用治理平台ZLAR：从网关到统一架构的演进与实践

use Hyperf\View\View；的生命周期的庖丁解牛

为OpenClaw智能体工作流配置Taotoken作为核心模型提供商

DAB的TPS控制闭环到底怎么调？从开环公式到稳定PI调节的实战心得

对比直接使用官方 API 体验 Taotoken 聚合接入在配置简化上的优势