1.特征编码
1.1独热编码。如,红\绿\蓝,没有顺序高低差异。可以用0,1,2;1,2,3分别表示,进行赋值。
1.2标签编码。如,小学\初中\高中\大学 ,存在递进高低顺序。可以用三个数值表示一个对象,100,010,001来分别表示。
2.划分数据集,通常按8:2或7:3来划分,训练集通常多一些。
3.常见模型:逻辑回归,决策数,支持向量机,随机森林,XGboost
4.机器学习和深度学习的区别。机器学习的模型是已封装的,而深度学习的模型内容还有修改的空间
5.人为设定的参数信息称为外参(超参)。在模型训练后得到的参数信息称为内参,这部分参数信息是拟合后的,不可人为修改。
6.模型实例化其实就是训练模型中选择模型并选择外参的过程(讲得很厉害的样子只是为了理论化在老板面前装b)。
6.1外参也可以不选择,这样模型会使用默认的外参。
7.混淆矩阵,分类问题的一种评估办法。分四种情况tp(预测正确的是),fp(预测错误的是),tn(预测正确的否),fn(预测错误的否)。
7.1用医疗患病预测举例:tp和tn为最佳预测结果,其次是fp(虽然可能提高成本,但不会造成更严重的问题),fn(最差预测结果,病情恶化,应尽量避免)。要减少漏报,采用召回率进行模型评估
7.2用邮件拦截举例:tp和tn为最佳预测结果,其次是fn(虽然不能拦截垃圾邮件,但还可以手动再清除),fp(最差预测结果,可能把重要文件拦截删除,应尽量避免)。要减少误报,采用精确率进行模型评估
7.3准确率适合综合效果的模型评估。
8.回归问题的模型评估。
8.1 mse,对大误差敏感,关注极端值的误差,但脱落实际数值误差
8.2 rmse,对大误差敏感,误差单位不变
8.3 mae,对大误差不敏感,少量异常值使用
9.1 r^2,数值越大,预测越精准,误差越小
10.评估指标选择的依据:1.模型处理本身的需要 2.前人的科学做法。