本页目录
异常值是什么?
异常值是在明确模型或语境下,与可比较观测形成的模式相比,距离异常遥远或表现明显不一致的观测。它是一项需要调查的标记,不是数据错误的判决。参考总体、变量、时间窗口、转换和分析目的都是定义的一部分。
同一个数值在不同场景中结论可能相反:30℃对夏日下午很普通,对冷藏仓库却可能异常。因此,关键问题不是“数值有多大”,而是“相对于哪个合理参照,它为何不一致”。
异常值、极端值、错误和高影响点有何区别?
| 概念 | 核心问题 | 不能证明 |
|---|---|---|
| 异常值 | 观测是否与明确参照明显不一致? | 它一定错误或应该删除 |
| 极端值 | 观测是否接近样本或理论边界? | 它在模型下不合理 |
| 数据错误 | 是否有录入、单位、采集或处理失败证据? | 所有统计异常都是错误 |
| 异常事件 | 记录、关系、序列或群体模式是否偏离预期? | 某个单独字段必然极端 |
| 高影响点 | 纳入该点是否显著改变模型或决策? | 该点在单变量上离其他值很远 |
怎样写出可执行的异常值定义?
不要先运行算法再解释规则。一个可审计定义至少回答:谁与谁比较、评估什么、使用什么规则、标记后做什么。
示例:在每个产品类别和自然季度内,将交易金额低于Q1−1.5×IQR或高于Q3+1.5×IQR的记录标记为候选;处理前核验币种、重复、客户层级和源订单,并比较保留与合理处理后的结论。
| 要素 | 需要说明 |
|---|---|
| 分析单位 | 一行代表客户、订单、设备读数还是时间窗口 |
| 参考总体 | 哪些记录可比,是否按地区、产品、季节或工况分组 |
| 变量与表示 | 原始值、变换值、残差、组合特征或时序上下文 |
| 方法与参数 | IQR算法、阈值、Z分数、MAD缩放、模型和版本 |
| 调查与处置 | 来源核验、领域复核、责任人以及保留或修正规则 |
异常值有哪些主要类型?
某一变量相对参考分布异常偏高或偏低。
每个变量单看普通,但它们的组合关系不寻常。
只有在特定季节、地点、群体、工况或时间才异常。
一段序列或一组记录整体不寻常,单个点未必越界。
还可区分全局和局部异常。全局异常远离大多数数据;局部异常只相对附近同类稀疏,可使用局部离群因子LOF等方法辅助识别。
异常值为什么会出现?
| 来源 | 示例 | 下一步 |
|---|---|---|
| 录入或单位错误 | 厘米写成米、金额小数点错位 | 回到源记录确认并保留更正轨迹 |
| 采集与设备问题 | 传感器失准、断连后默认值 | 检查校准、日志和同期设备 |
| 数据管道问题 | 连接膨胀、重复、时区错位 | 验证键、行数、转换和版本 |
| 真实罕见事件 | 重大订单、设备故障、极端天气 | 保留并升级领域调查 |
| 新子群或混合总体 | 新客户层级、不同工况 | 重新分组或使用分层模型 |
| 过程漂移 | 均值、波动或关系持续改变 | 检查变点、时间线和上游变更 |
异常值会怎样影响统计分析?
少量异常值可能拉动均值、放大标准差、改变相关性、扭曲回归斜率,并影响置信区间、检验结论和模型训练;但它也可能是数据中最有价值的信号,揭示故障、欺诈、新需求或数据管道缺陷。
可同时报告中位数、IQR、稳健估计和均值,避免单一统计量被少量点支配。
欺诈、故障和风险监测中,异常可能正是目标,自动删除会破坏任务。
如何一步一步识别异常值?
- 定义问题和比较范围明确分析单位、总体、变量、时期、分组、目标和错误成本。
- 审计来源与质量检查缺失、单位、范围、重复、时间戳、连接、设备状态和转换。
- 可视化分布和关系结合直方图、箱线图、散点图、时间图与残差图检查结构。
- 选择有依据的方法依据分布、维度和样本量选择IQR、Z分数、MAD或多变量模型。
- 调查重点标记追溯源记录,比较同类数据并咨询领域负责人。
- 进行敏感性分析比较合理阈值、方法、分组与处理方式下结论是否改变。
- 记录并监控保留原始值、标记、规则版本、证据、复核人和决定。
IQR、Z分数、MAD和其他方法怎样选择?
| 方法 | 适合场景 | 主要限制 |
|---|---|---|
| 箱线图与IQR | 偏态或非正态单变量数据 | 分组和四分位算法会影响边界 |
| Z分数 | 大致对称、均值和标准差有意义的数据 | 极端值会影响中心与尺度 |
| 中位数与MAD | 受污染或重尾的单变量数据 | 必须说明MAD定义和缩放 |
| 正式异常值检验 | 假设可辩护、候选数预先明确的小样本 | 不能任意重复检验并逐个删除 |
| 多变量或机器学习方法 | 相关、高维、局部或非线性模式 | 需要缩放、验证、解释和漂移治理 |
IQR异常值计算示例
考虑教学数据:4、5、5、6、6、7、8、30。采用上下两半分别取中位数的约定,Q1为5,Q3为7.5,IQR为2.5。
下围栏 = 5 − 1.5 × 2.5 = 1.25 上围栏 = 7.5 + 1.5 × 2.5 = 11.2530超过上围栏,因此被规则标记,但计算无法说明30是单位错误、大宗订单还是真实重件。下一步必须检查源记录、单位、同类对象和下游影响。
复现提示:不同软件的四分位插值约定可能不同。报告应注明工具、版本、分位数算法、分组和阈值。
为什么同一个阈值不能用于所有数据?
- 偏态和重尾:正常尾部可能被全局Z分数大量误报。
- 季节和趋势:全局阈值可能把旺季当异常,应建立同类时间基线。
- 混合总体:不同产品、地区或工况混合会制造假异常。
- 小样本:分位数和方差估计不稳定,复杂阈值可能呈现虚假精度。
- 多个异常:极端点会互相掩蔽,单异常检验不应反复使用。
- 高维数据:距离可能趋同,需要验证特征表示和有效样本量。
异常值应该保留、修正还是排除?
| 证据状态 | 建议处理 | 必须保留 |
|---|---|---|
| 源证据确认录入或单位错误 | 依据来源修正分析副本 | 原始值、正确值、证据和修改时间 |
| 确认重复或管道错误 | 修复流程,按规则去重或重算 | 规则版本和受影响范围 |
| 真实且与目标相关 | 保留并报告,可使用稳健方法 | 业务语境和对结论的影响 |
| 属于不同总体 | 分组、分层或建立独立模型 | 分群依据和样本覆盖 |
| 原因未知 | 暂时保留,标记待复核 | 不确定性和后续责任人 |
怎样验证异常值处理没有制造偏差?
- 比较合理分析展示原始数据、证据修正数据、稳健方法和可辩护排除下的结果。
- 检查方向和量级记录均值、中位数、相关、系数、区间或决策是否发生实质变化。
- 检查群体影响确认规则是否不成比例地标记某地区、设备或少数群体。
- 验证阈值稳定性比较合理分组、时间窗口和参数下候选是否稳定。
- 保留反证记录未被支持的解释和仍未解决的不确定性。
结合关联数据调查异常候选
准备稳定记录ID、原始值、分析值、方法、阈值、时间戳、分组、来源文档和复核状态。InfiniSynapse可辅助探索相关证据,但业务使用前仍需完成统计与领域验证。
打开在线工作区异常值分析最常见的错误
- 把最大值或最小值自动认定为异常值。
- 把所有标记直接删除,混淆检测规则与数据质量判断。
- 对不同群体、季节和单位使用同一个全局阈值。
- 忽略偏态、重尾和时间结构,机械使用绝对Z分数大于3。
- 先看到结果,再挑选能得到偏好结论的阈值。
- 只报告清洗后结果,不展示原始数据和敏感性分析。
- 覆盖原始值,导致来源、复核和恢复无法进行。
- 把统计异常当成因果解释,不调查数据生成过程。
关于异常值定义的常见问题
统计学中的异常值是什么?
异常值是在明确模型或语境下,与可比较观测形成的模式相比,距离异常遥远或表现明显不一致的观测。参考群体、变量、时间窗口和分析目的都是定义的一部分。
异常值一定意味着数据错误吗?
不一定。异常值可能来自录入、单位或采集错误,也可能是真实罕见事件、新子群、过程变化、欺诈、设备故障或模型不完整。
最大值和最小值都是异常值吗?
不是。每组数据都有最大值和最小值,只有当它们相对于合理参照明显不一致时才会被标记为异常。多变量异常也可能由多个单看普通的数值组合形成。
如何识别异常值?
先定义可比总体并检查数据质量,再使用箱线图、直方图、散点图和时间图理解结构,随后依据分布、维度和目标选择IQR、Z分数、MAD或多变量方法,最后进行来源和领域复核。
Z分数大于3就一定是异常值吗?
不是。绝对Z分数大于3只是常见经验规则,适合均值和标准差有意义、分布大致对称的场景;偏态、重尾、小样本或多个极端值会使判断失真。
异常值应该删除吗?
只有来源证据确认记录错误,或预先定义且可辩护的规则支持排除时才应删除或修正。真实罕见值通常应保留、分组、稳健建模或单独报告。
