本页目录
如何快速查找异常值?
可靠流程是:定义可比总体,检查单位、缺失、重复和来源,用直方图、箱线图、散点图或时间图理解结构,再选择IQR、Z分数、MAD或复杂数据方法生成候选,最后逐条复核。阈值只能产生调查清单,不能独立证明数据错误。
偏态或分布未知的单变量数据通常从IQR开始;近似对称且均值、标准差有代表性时可检查Z分数;担心极端值影响尺度时可使用MAD。多变量组合、局部密度和时间结构则需要相应模型。
查找异常值前先定义比较范围
异常总是相对于参照而言。把不同产品、地区、季节、设备或工况混在一起,全局阈值可能把正常群体差异误判为异常。开始计算前应明确分析单位、可比总体、变量单位、时间窗口、分析目标以及误报和漏报成本。
| 项目 | 需要回答 | 常见风险 |
|---|---|---|
| 分析单位 | 一行代表订单、客户、设备读数还是时间窗口? | 混合粒度造成重复权重 |
| 可比总体 | 哪些记录应相互比较,是否需要分组? | 群体混合制造假异常 |
| 变量与单位 | 分析原值、对数、残差还是组合特征? | 单位错位或变换错误 |
| 时间范围 | 趋势、季节和变化点如何处理? | 把正常变化当异常 |
| 行动目标 | 用于清洗、告警、调查还是模型稳健性? | 阈值与决策成本不匹配 |
先排查数据问题,再运行异常检测
- 单位和量纲:确认货币、温度、长度和时间单位一致,并保留转换记录。
- 范围和哨兵值:识别−999、999999、零填充以及业务上不可能的值。
- 重复与连接:检查重复采集、主键错误和一对多连接导致的行数膨胀。
- 时间对齐:核对时区、采样频率、延迟、回填和事件窗口。
- 来源与版本:保存字段、提取时间、转换代码和原始记录ID。
先审计的原因:算法可以稳定地把管道错误排在最前面,却无法判断它是不是错误。质量缺陷未修复时,调整阈值只是掩盖上游问题。
用哪些图形查找异常候选?
| 图形 | 能发现什么 | 注意事项 |
|---|---|---|
| 直方图或密度图 | 偏态、重尾、多峰、截断和离散化 | 分箱宽度会改变形状 |
| 箱线图 | 中位数、IQR、须线外候选和群体差异 | 须线外点不是删除清单 |
| 散点图 | 变量关系、簇、非线性和组合异常 | 点重叠可能隐藏结构 |
| 时间图 | 尖峰、漂移、季节和持续水平变化 | 需要同类时段基线 |
| QQ图 | 与假设分布的尾部偏离 | 小样本需谨慎解释 |
可视化用于理解分布和检查方法假设,不是用肉眼宣布异常。最终规则应被记录、复现并与证据复核结合。
识别异常值的七步工作流
- 定义观察对象与参照写明分析单位、总体、分组、时间窗口和决策目标。
- 核验来源与质量排除单位、重复、连接、缺失和时间处理造成的假信号。
- 观察分布与关系至少检查一个边际图和一个关系图或时间图。
- 选择方法与阈值让方法匹配分布、维度、样本量和行动成本。
- 生成候选而非结论保存连续分数、阈值、分组和规则版本。
- 调查重点标记回到源记录,比较同类样本并寻找支持与反对证据。
- 验证并记录处置做敏感性分析,记录复核人、证据、决定和后续监控。
应该使用哪种异常值检测方法?
| 数据特征 | 优先起点 | 需要核查 |
|---|---|---|
| 单变量、偏态或分布未知 | IQR、箱线图、分位数 | 分组与四分位算法 |
| 单变量、大致对称 | Z分数并配合图形 | 均值和标准差是否稳定 |
| 重尾或受污染 | 中位数与MAD、稳健模型 | MAD缩放与零MAD |
| 假设明确的小样本 | Grubbs或广义ESD等检验 | 分布假设与候选数量 |
| 多变量相关数据 | 稳健马氏距离、Isolation Forest | 缩放、协方差与维度 |
| 局部密度不同 | LOF等局部方法 | 邻居是否业务可比 |
| 趋势与季节时间序列 | 分解、预测残差、变化检测 | 时间外验证与漂移 |
如何使用IQR查找异常值?
四分位距方法先计算第一四分位数Q1和第三四分位数Q3,再得到IQR。常用围栏如下:
下围栏 = Q1 − 1.5 × IQR 上围栏 = Q3 + 1.5 × IQR以数据3、4、5、5、6、7、8、20为例,采用上下两半分别取中位数的约定,Q1为4.5,Q3为7.5,IQR为3,上围栏为12,因此20进入复核队列。
重要限制:20高于围栏并不证明它错误。生产报告还应记录软件、版本、分位数算法和分组规则,因为不同实现可能产生不同边界。
如何用Z分数和MAD识别异常值?
z=(x−均值)/标准差。绝对值大于3是常见经验线,但不适用于所有分布。偏态、重尾和多个极端值会同时影响均值与标准差。
M=0.6745×(x−中位数)/MAD是常见形式。MAD对少数极端值更稳健,但必须说明使用原始MAD还是已按正态分布缩放的MAD。
若大量数值相同,MAD可能为0,此时修正Z分数无法正常计算。不要加入任意极小数掩盖问题,应检查离散结构、分组或换用更合适的方法。
怎样在多变量与时间序列中查找异常值?
多变量异常可能由一组单独看来正常的数值共同形成。使用稳健马氏距离、Isolation Forest或局部离群因子LOF前,应先处理特征尺度、缺失、相关性和训练数据污染。
时间序列包含趋势和季节时,不应直接对全部观测套全局IQR。可以先按同类时段建立基线,或检测分解残差、预测区间和变化率。持续的机制变化更适合变点检测,完整流程可参考时间序列异常检测指南。
更改数据前怎样验证异常值标记?
- 回到源记录检查原始文件、数据库行、设备日志、单位和转换过程。
- 比较邻近与同类展示同产品、群体、工况或时间段的可比记录。
- 比较合理方法检查IQR、MAD、分组规则或参数变化下候选是否稳定。
- 进行领域复核让理解数据生成过程的人判断其业务含义并记录证据。
- 测量下游影响比较保留、修正、稳健建模和排除后的结论。
发现异常值后应该怎么做?
| 复核结果 | 建议行动 | 避免做法 |
|---|---|---|
| 确认录入、单位或采集错误 | 依据源证据修正分析副本,并修复上游流程 | 无轨迹覆盖原始值 |
| 确认重复或连接错误 | 修复键与逻辑,重跑受影响范围 | 只删除当前记录 |
| 真实罕见事件 | 保留、报告或按风险路径升级 | 因影响均值而删除 |
| 不同总体或新群体 | 分组、分层或单独建模 | 继续使用全局阈值 |
| 原因未知 | 保留标记,补充证据并做敏感性分析 | 假装已经确认错误 |
把异常候选与关联证据放在一起复核
准备稳定记录ID、原始值、分析值、方法、阈值、分组、时间戳、来源和复核状态。InfiniSynapse可辅助探索相关数据库、文件和文档,但业务行动前仍需完成统计与领域验证。
打开在线工作区查找异常值时的常见错误
- 没有定义可比总体,直接对全表套一个阈值。
- 只看箱线图须线外点,不检查偏态、季节和群体差异。
- 把最大值、最小值或绝对Z分数大于3自动当作错误。
- 使用MAD时不说明缩放约定,造成公式重复缩放。
- 看到结果后反复调整阈值,直到得到期望结论。
- 自动删除候选而不追溯来源和业务语境。
- 只保存清洗后数据,丢失原始值、规则版本和复核决定。
关于查找异常值的常见问题
查找异常值最常用的方法是什么?
单变量数据通常先用箱线图与IQR、Z分数或MAD生成候选;多变量、局部密度和时间序列问题需要匹配数据结构的方法。任何阈值都不能代替来源与业务复核。
如何用IQR查找异常值?
计算Q1、Q3和IQR,常用候选范围是低于Q1减1.5倍IQR或高于Q3加1.5倍IQR。越过围栏只表示需要复核,不等于数据错误。
Z分数什么时候适合使用?
当数据大致对称,均值和标准差具有代表性时可使用Z分数。偏态、重尾、小样本或存在多个极端值时,应优先考虑稳健方法并配合图形检查。
箱线图上的点都应该删除吗?
不应该。须线外点可能是录入错误,也可能是真实罕见事件、不同群体或过程变化。删除前应检查原始记录、单位、分组和下游影响。
时间序列能直接使用全局IQR吗?
通常不建议。趋势、季节性和工况变化会使全局围栏失真,应先建立同类时段基线,或对分解残差、变化率和预测区间进行检测。
发现异常值后应该做什么?
先追溯来源,区分确认错误、真实罕见事件、不同总体、漂移和未知原因,再决定修正、保留、分组、稳健建模或升级调查,并保存原始值与决策记录。
