1. 知识发现包含以下几个步骤:
(1)数据清理,清除噪声或不一致数据;
(2)数据集成,多种数据源可以组合在一起;
(3)数据选择,从数据库中提取与分析任务相关的数据;
(4)数据变换,数据变换或统一成适合挖掘的形式;
(5)数据挖掘,使用只能方法提取数据模式;
(6)模式评估,根据某种兴趣度度量,识别提供知识的真正有趣的模式;
(7)知识表示,使用可视化和知识表示技术,向用户提供挖掘的知识。
2. 数据清洗中缺失值处理的六种方法包括:
(1)忽略元组;
(2)人工填写缺失值;
(3)使用一个全局常量填写缺失值;
(4)使用属性的中心度量(如均值或中位数)填充缺失值;
(5)使用与给定元组属于同一类的所有样本的属性均值或中位数填写。
(6)使用最可能的值填写,即基于一些预测工具确定缺失值。
3. 分类过程包括以下阶段:
第一阶段:模型构造。
准备好训练数据集;
判别好条件属性和类别属性;
建立分类模型。
第二阶段:模型测试
准备好测试数据集;
用模型推导出的类别和已知的类别比较;
计算准确度,判断模型优劣。
第三阶段:模型应用
利用得到的分类模型,预测类别未知的样本的所属类别。
4. 分类的定义:总结已有类别的对象的特点,并根据这些特点进行未知类别对象的类别预测的过程。
聚类分析的定义:把一组个体按照相似性归类为若干个类别,其目的是使同一类别的个体间的差别尽可能小,而不同个体间的差别尽可能大。
区别:分类总是在特定的类标识下寻求新元素属于哪一类,是有监督学习;而聚类分析则是通过对数据的分析、比较生成新的类标识,是无监督学习。
发布于 陕西
