ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

机器学习-错误分析-常见错误

机器学习-错误分析-常见错误

在帮助诊断运行,选择下一步方法尝试提高学习算法的性能中

偏差和方差是最重要的概念,错误分析排在第二位

假设有500个交叉样本其中有100个样本是被分错到了,我们可以专注于这100个错误样本进行分析,从而找到为什么与归类错误的原因

21个药品垃圾邮件

3个故意拼写做邮件

7封路由有关的邮件

18个视图获取密码

5个嵌入图像的邮件

我们要注意,这些类别是可以重叠的,他们不是互斥的,一封邮件极有可能是药品和故意拼写错误都有

如果总的样本数是1000000个,错误分了500个,我们没有资源吧500个全部都看一遍,所以我们可以均匀的抽搐100个进行查看,

我们发现药品的错误比较多,所以我们可能会增加更多的数据,而且是药品数据,以便算法可以更精确的判断这一类问题。或者提出特定的药品,

因此错误分析目的是通过手动检查一组你的算法错误分类,或者错误标记的样本,通常这会激发你下一步的可能尝试,的有用想法,有时他可以告诉你那些类型的错误足够罕见。不值得你花太多的时间去修复,因此回到这个列表

偏差方差告诉我们,收集更多的数据是否有帮助,

根据我们刚刚讨论的错误分析中,看起来更复杂的电子邮件特征可能会有帮助,但只是略有帮助,而且更复杂特征来检测药品垃圾邮件或钓鱼邮件可能会有很大的帮助,

而检测拼写错误的功能几乎不会有什么帮助

总的来说,偏差方差诊断以及这种形式的错误分析对于筛选或决定那些模型更改更有希望尝试,非常有帮助,

错误分析的局限性是对于人类擅长的问题来说他更容易进行,人类就很容易判断一个邮件是否是垃圾邮件,为什么算法出错,

对于人类也不擅长的任务,错误分析可能会更难一些,

所以高方差和高偏差决定我们应该怎么做,而多无分析决定我们怎么改,怎么优化

他们都是我为了提高模型的准确度,但是两者的侧重点不同,

偏差方差框架是通用顶层诊断工具,帮我们确定优化大方向; 多重共线性是线性模型特有的特征层面诊断工具,用于定位一类具体问题; 二者目标都是提升模型效果,但层级、适用范围、解决的问题维度完全不同,不是 “前期 vs 后期” 的关系,而是 “宏观战略 vs 局部特征问题” 的关系。

返回列表