刘力+王立松+吴非
摘 要:由于客观世界的复杂性,信息缺失、不确定信息是普遍存在的。数据库作为表达现实世界的一种工具,使用空值来表达信息缺失的问题。针对关系数据库中的空值问题,提出一种基于模糊聚类和线性回归的空值估计方法。该方法首先对数据表中的数据进行挖掘,找出与被估计属性相关联的属性集。该过程仅利用数据本身提供的信息,避免了由专家决定条件属性时由于主观性造成的误差。其次根据所得属性集进行模糊聚类得到对原始数据的一个划分,再基于所得分簇和线性回归给出一个估计关系表中空值的方法。最后利用平均绝对错误率来衡量算法估值的准确率。实验结果表明该方法估值的结果与其他方法相比具有较高的准确率。endprint