微信公众号搜"智元新知"关注
微信扫一扫可直接关注哦!

如果一小时内少于 3 个数据点,则清除数据

如何解决如果一小时内少于 3 个数据点,则清除数据

我对此很陌生,所以请耐心等待。我有一个 df,其中索引采用日期时间格式。我的其他列是浓度和一个仅由 1 组成的计数列。

时间戳 浓度 计数
2018-01-01 08:07:00 32.675305 1
2018-01-01 08:20:00 22.816844 1
2018-01-01 08:28:00 17.183438 1
2018-01-01 08:37:00 18.591789 1

我想通过仅包含每小时记录至少 3 个浓度值的数据来清理 df。

我尝试按小时重新采样,然后获取计数列的总和,该列显示每小时的数据点数是否满足阈值 3。然后我可以删除计数小于 3 的行。

df2 = df.resample('H').sum()
df3 = df2[~(df2['Count'] < 3)]

不过,从这里开始,浓度也被求和,这最终是我不想要的。我想知道是否有办法在重新采样但没有清除数据的情况下返回?

还有其他更好的方法可以做到这一点吗?

解决方法

您应该能够加入重新采样的数据帧(使用向下舍入的时间戳作为键)以提供一列,指定在该记录的小时内是否有超过 3 次测量。例如:

df = df.set_index('Timestamp')
df2 = df.resample('H').sum()
df['floor'] = df.index.floor('H')
df.join((df2['Count'] >= 3).rename('keep'),on='floor')

result 将有一个名为“keep”的真/假列,您可以使用它来保留/丢弃您需要的记录。

,

您可以一次组合多个操作,必须添加额外的行来说明

import pandas as pd
from io import StringIO

df = pd.read_csv(StringIO(
"""Timestamp    Concentration   Count
2018-01-01 08:07:00   32.675305   1
2018-01-01 08:20:00   22.816844   1
2018-01-01 08:28:00   17.183438   1
2018-01-01 09:37:00   18.591789   1
2018-01-01 09:37:00   18.591789   1"""),sep=" \s+",parse_dates=["Timestamp"])



>>> df[df.groupby(df.Timestamp.dt.floor('h'))['Count'].transform('count') > 2]
            Timestamp  Concentration  Count
0 2018-01-01 08:07:00      32.675305      1
1 2018-01-01 08:20:00      22.816844      1
2 2018-01-01 08:28:00      17.183438      1

正如前面的回答中已经提到的,groupby 应该在时间戳列 floor 上执行到一个小时。然后,使用 transform 将每小时计数值分配给组。最后,只使用计数 > 2 的行。

版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 [email protected] 举报,一经查实,本站将立刻删除。