在我之前的一篇专栏文章《浅谈工业级推荐系统》(http://t.cn/A6bGQ9qh)中,我谈到了在绝大多数情况下,机器学习系统的目标和产品目标之间存在着巨大差异,因此而带来的有可能模型的提高未必能带来更好的产品体验这一问题。
在近日举行的人工智能顶级会议NeurIPS 2020上,来自Spotify、微软的一组学者就做了题为“Beyond Accuracy: Grounding Evaluation Metrics for Human-Machine Learning Systems”的短课程(http://t.cn/A6qV1www)方便大家入门一些工业界比较常见的更加复杂的衡量模型好坏的办法,包括一些如何平衡多个指标等前沿研究和思考。整个视频有两个半小时左右,建议全部观看。
Fernando Diaz(https://fernando.diaz.nyc/)算是信息检索界的知名学者,有SIGIR、WSDM、CIKM多个最佳论文奖,在雅虎、Spotify和微软供过职。Praveen Chandar和Brian St. Thomas目前都是Spotify的研究人员。
