统计分析 · 数据质量

如何查找异常值:从可视化到证据复核的完整流程

先定义可比总体并核验数据质量,再用图形和统计规则生成候选,最后结合来源、上下文与敏感性分析决定如何处理。

更新于 2026年8月14日阅读约 15 分钟InfiniSynapse
从数据质量检查、可视化、统计规则到异常候选复核的完整工作流
本页目录

如何快速查找异常值?

可靠流程是:定义可比总体,检查单位、缺失、重复和来源,用直方图、箱线图、散点图或时间图理解结构,再选择IQR、Z分数、MAD或复杂数据方法生成候选,最后逐条复核。阈值只能产生调查清单,不能独立证明数据错误。

偏态或分布未知的单变量数据通常从IQR开始;近似对称且均值、标准差有代表性时可检查Z分数;担心极端值影响尺度时可使用MAD。多变量组合、局部密度和时间结构则需要相应模型。

查找异常值前先定义比较范围

异常总是相对于参照而言。把不同产品、地区、季节、设备或工况混在一起,全局阈值可能把正常群体差异误判为异常。开始计算前应明确分析单位、可比总体、变量单位、时间窗口、分析目标以及误报和漏报成本。

异常值识别的准备字段
项目需要回答常见风险
分析单位一行代表订单、客户、设备读数还是时间窗口?混合粒度造成重复权重
可比总体哪些记录应相互比较,是否需要分组?群体混合制造假异常
变量与单位分析原值、对数、残差还是组合特征?单位错位或变换错误
时间范围趋势、季节和变化点如何处理?把正常变化当异常
行动目标用于清洗、告警、调查还是模型稳健性?阈值与决策成本不匹配

先排查数据问题,再运行异常检测

  • 单位和量纲:确认货币、温度、长度和时间单位一致,并保留转换记录。
  • 范围和哨兵值:识别−999、999999、零填充以及业务上不可能的值。
  • 重复与连接:检查重复采集、主键错误和一对多连接导致的行数膨胀。
  • 时间对齐:核对时区、采样频率、延迟、回填和事件窗口。
  • 来源与版本:保存字段、提取时间、转换代码和原始记录ID。

先审计的原因:算法可以稳定地把管道错误排在最前面,却无法判断它是不是错误。质量缺陷未修复时,调整阈值只是掩盖上游问题。

用哪些图形查找异常候选?

按问题选择异常值可视化
图形能发现什么注意事项
直方图或密度图偏态、重尾、多峰、截断和离散化分箱宽度会改变形状
箱线图中位数、IQR、须线外候选和群体差异须线外点不是删除清单
散点图变量关系、簇、非线性和组合异常点重叠可能隐藏结构
时间图尖峰、漂移、季节和持续水平变化需要同类时段基线
QQ图与假设分布的尾部偏离小样本需谨慎解释

可视化用于理解分布和检查方法假设,不是用肉眼宣布异常。最终规则应被记录、复现并与证据复核结合。

识别异常值的七步工作流

  1. 定义观察对象与参照写明分析单位、总体、分组、时间窗口和决策目标。
  2. 核验来源与质量排除单位、重复、连接、缺失和时间处理造成的假信号。
  3. 观察分布与关系至少检查一个边际图和一个关系图或时间图。
  4. 选择方法与阈值让方法匹配分布、维度、样本量和行动成本。
  5. 生成候选而非结论保存连续分数、阈值、分组和规则版本。
  6. 调查重点标记回到源记录,比较同类样本并寻找支持与反对证据。
  7. 验证并记录处置做敏感性分析,记录复核人、证据、决定和后续监控。

应该使用哪种异常值检测方法?

异常值方法选择决策表
数据特征优先起点需要核查
单变量、偏态或分布未知IQR、箱线图、分位数分组与四分位算法
单变量、大致对称Z分数并配合图形均值和标准差是否稳定
重尾或受污染中位数与MAD、稳健模型MAD缩放与零MAD
假设明确的小样本Grubbs或广义ESD等检验分布假设与候选数量
多变量相关数据稳健马氏距离、Isolation Forest缩放、协方差与维度
局部密度不同LOF等局部方法邻居是否业务可比
趋势与季节时间序列分解、预测残差、变化检测时间外验证与漂移

如何使用IQR查找异常值?

四分位距方法先计算第一四分位数Q1和第三四分位数Q3,再得到IQR。常用围栏如下:

下围栏 = Q1 − 1.5 × IQR  上围栏 = Q3 + 1.5 × IQR

以数据3、4、5、5、6、7、8、20为例,采用上下两半分别取中位数的约定,Q1为4.5,Q3为7.5,IQR为3,上围栏为12,因此20进入复核队列。

重要限制:20高于围栏并不证明它错误。生产报告还应记录软件、版本、分位数算法和分组规则,因为不同实现可能产生不同边界。

如何用Z分数和MAD识别异常值?

Z分数

z=(x−均值)/标准差。绝对值大于3是常见经验线,但不适用于所有分布。偏态、重尾和多个极端值会同时影响均值与标准差。

修正Z分数与MAD

M=0.6745×(x−中位数)/MAD是常见形式。MAD对少数极端值更稳健,但必须说明使用原始MAD还是已按正态分布缩放的MAD。

若大量数值相同,MAD可能为0,此时修正Z分数无法正常计算。不要加入任意极小数掩盖问题,应检查离散结构、分组或换用更合适的方法。

怎样在多变量与时间序列中查找异常值?

多变量异常可能由一组单独看来正常的数值共同形成。使用稳健马氏距离、Isolation Forest或局部离群因子LOF前,应先处理特征尺度、缺失、相关性和训练数据污染。

时间序列包含趋势和季节时,不应直接对全部观测套全局IQR。可以先按同类时段建立基线,或检测分解残差、预测区间和变化率。持续的机制变化更适合变点检测,完整流程可参考时间序列异常检测指南

更改数据前怎样验证异常值标记?

  1. 回到源记录检查原始文件、数据库行、设备日志、单位和转换过程。
  2. 比较邻近与同类展示同产品、群体、工况或时间段的可比记录。
  3. 比较合理方法检查IQR、MAD、分组规则或参数变化下候选是否稳定。
  4. 进行领域复核让理解数据生成过程的人判断其业务含义并记录证据。
  5. 测量下游影响比较保留、修正、稳健建模和排除后的结论。

发现异常值后应该怎么做?

异常值处置矩阵
复核结果建议行动避免做法
确认录入、单位或采集错误依据源证据修正分析副本,并修复上游流程无轨迹覆盖原始值
确认重复或连接错误修复键与逻辑,重跑受影响范围只删除当前记录
真实罕见事件保留、报告或按风险路径升级因影响均值而删除
不同总体或新群体分组、分层或单独建模继续使用全局阈值
原因未知保留标记,补充证据并做敏感性分析假装已经确认错误

把异常候选与关联证据放在一起复核

准备稳定记录ID、原始值、分析值、方法、阈值、分组、时间戳、来源和复核状态。InfiniSynapse可辅助探索相关数据库、文件和文档,但业务行动前仍需完成统计与领域验证。

打开在线工作区

查找异常值时的常见错误

  • 没有定义可比总体,直接对全表套一个阈值。
  • 只看箱线图须线外点,不检查偏态、季节和群体差异。
  • 把最大值、最小值或绝对Z分数大于3自动当作错误。
  • 使用MAD时不说明缩放约定,造成公式重复缩放。
  • 看到结果后反复调整阈值,直到得到期望结论。
  • 自动删除候选而不追溯来源和业务语境。
  • 只保存清洗后数据,丢失原始值、规则版本和复核决定。

关于查找异常值的常见问题

查找异常值最常用的方法是什么?

单变量数据通常先用箱线图与IQR、Z分数或MAD生成候选;多变量、局部密度和时间序列问题需要匹配数据结构的方法。任何阈值都不能代替来源与业务复核。

如何用IQR查找异常值?

计算Q1、Q3和IQR,常用候选范围是低于Q1减1.5倍IQR或高于Q3加1.5倍IQR。越过围栏只表示需要复核,不等于数据错误。

Z分数什么时候适合使用?

当数据大致对称,均值和标准差具有代表性时可使用Z分数。偏态、重尾、小样本或存在多个极端值时,应优先考虑稳健方法并配合图形检查。

箱线图上的点都应该删除吗?

不应该。须线外点可能是录入错误,也可能是真实罕见事件、不同群体或过程变化。删除前应检查原始记录、单位、分组和下游影响。

时间序列能直接使用全局IQR吗?

通常不建议。趋势、季节性和工况变化会使全局围栏失真,应先建立同类时段基线,或对分解残差、变化率和预测区间进行检测。

发现异常值后应该做什么?

先追溯来源,区分确认错误、真实罕见事件、不同总体、漂移和未知原因,再决定修正、保留、分组、稳健建模或升级调查,并保存原始值与决策记录。

异常值识别的权威资料