|
方差阈值最大的优势是快且安全。它是纯无监督操作,不需要标签、不依赖模型假设,毫秒级即可完成数万维特征的粗筛,且完全不存在数据泄露风险。 在文本tf-idf矩阵、用户行为one-hot编码等超高维稀疏场景中,它往往是特征工程pipeline的第一道防线。 但它也有明确的能力边界:方差≠预测力。 一个低方差特征可能对某个稀有类别有极强的区分度(如“是否vip”仅5%为真,但精准标识高价值用户),方差阈值会误杀它;而一个高方差的自增id与目标变量毫无因果关系,方差阈值却无法识别。 因此,它只适合做“粗筛”,精细选择仍需交给互信息、lasso等有监督方法。
|