基于Worker 权重差分进化与Top-k排序的结果汇聚算法
2021-02-28邢玉萍詹永照
通信学报 2021年1期
邢玉萍,詹永照
(1.江苏大学计算机科学与通信工程学院,江苏 镇江 212013;2.江苏省工业网络安全技术重点实验室,江苏 镇江 212013)
1 引言
众包[1]利用群体Worker 的智慧解决问题,已成为数据处理的有力机制,特别是非结构化数据,如图像、视频和文本,出现了使用人工完成数据处理的任务,包括排序[2]、聚类[3]、最大值求解[4]、过滤[5]和去重[6]等。
目前,传统的数据库管理系统和搜索引擎难以较好地完成排序任务,例如对全球大学排名排序、某领域权威论文排序,原因有以下几点。1) 相对封闭世界的假设,即数据都已存储在数据库里,不在数据库里的数据就是不存在的,并且数据库中缺少明确标注的相关信息,不能根据模糊标准进行匹配、排序或聚合结果。但是互联网环境下信息量急剧增加,未存储在数据库的数据并不意味着不存在,人们有能力在多个搜索引擎和参考资料等工具的帮助下,找到目前没有的信息。2) 缺乏对语义的理解,特别是排序任务,并不能很好地从数据库中将相关信息提取出来自动排序。但是,人们却比较擅长这些计算机很难或者不可能完成的任务。
快速获得高质量的解决方案是众包请求者的目的。完成任务的Worker 主要来自普通大众,一般不具有提供高质量解决方案的特征,因此请求者通常采用任务冗余发放的算法,将相同任务发放给多个Worker,然后对Worker 的提交结果进行汇聚得到合适的解决方案。发布排序任务一般有2 种形式:1) 将任务拆分成微任务,以成对比较的形式进行分发,利用推理减少任务量,这种方式在任务量大时任务拆分困难、代价大、完成时间和完成质量难以保证[7];……
登录APP查看全文
