一种高效防抄袭的由粗到细的框架(3)
其中,ε(ε∈[0,1])是缩放参数,增大ε值将导致遍历更多的段落,并消耗更多的计算时间。根据我们的经验研究(见6.3节),使用较小的ε值在检测单个抄袭段落时更合适,同时大的ε值适合检测抄袭多个段落的文章。
因为在句子级别我们使用大词汇表V2(见3.2节和3.3节)中词(指示对应词条的出现)
Sen
的索引数来作为每个句子节点的签名S。在我们的应用中,将不考虑元素数量小于3的签名。然后定义两个句子k和l的重叠率,句子k在查询文档中,l在候选文档中。
设置另外一个前提τ(τ∈[0.5,1])来控制哪个句子将被认为是抄袭的部分,并进行融合距离处理。查询文档Dq和候选文档Dc(Dc∈Φ)之间的总体抄袭距离定义如下:
其中,Nq和Nc分别表示查询文档和候选文档的段落数,Nq,iSen和Nc,jSen分别表示第i个段落Pi(Pi∈Dq)和第j个段落Pj(Pj∈Dc)的句子数,并预定义一个很大的值κ表示距离函数找不到匹配。Algorithm 1.给出完整的基于等级的PD算法。
q
q
c
c
5.2 自动检测抄袭
自动的PD指设定一个阈值θ在源文档上做二值判断。如果所查询的文档的确是抄袭的,则它与源文档之间的相似度一般要比它和其他文章之间的相似度大。因此用户可以设置一个合适的阈值将源文档标出,并自动地找到源文档。除了基于等级的PD需要返回源文档列表外,自动的PD和基于等级的PD在步骤上基本一样。此外,我们使用下面的公式(27)来代替公式(26),因为我们使用相似度作为度量而非不相似度。
如果相似度比阈值大,则此文档就被认为是抄袭源,通过这种方法,用户将可以节省进一步检查等级列表。
实际上,就计算复杂度而言,提供一个全面的分析表达式不合适的,因为它依赖于实际的文档数据和我们使用的参数,例如,文档的尺寸越大,系统花费在比较查询文档和候选文档上的时间就越多;另一方面,缩放参数ε也影响查询的响应时间,增大ε,例如ε=1,显然会导致更多的段落比较计算。增大距离前提,将导致给距离融合带来产生更多的噪声,对检测性能下降。根据我们的实验,通常ε取小于0.5效果会足够的好。对于计算开销的花费,我们也进行了定性的研究(见6.5节)。
6. 实验
在这一部分,我们执行了详细的实验来作为我们所提出的PD方法的有效验证。这部分包括数据集描述(详见6.1节)、相关DR的性能(详见6.2节)、PD的性能(详见6.3节),参数影响的研究(详见6.4节)和计算时间的定性研究(详见6.5节)。
6.1 数据集和实验环境搭建
我们执行了大规模的实验来显示我们所提出的PD方法的性能。我们已经收集了一个文档数据集“Html_CityU1”,它包含26个种类[2-4]。每个类别包括400篇文档,总共加一起有10400篇文档。为了提供一个更真实的测试平台,我们建立的数据集中所包含的文档大小从几百个词到两万个词不等。对于每个类别的400篇文档,都是使用一组关键字从Google中检索得到的,一些关键字在不同的类别中有所重复,但是不同类别的关键字是不一样的,实验的执行是由两部分组成的,第一部分是在相关文档的DR上评价检索的性能,第二部分是执行PD。数据集首先分成一个候选集和一个测试集,用来作为查询使用。从26个类别中随机地选择出1040个测试文档,即26×40。余下的9360个文档用来作为候选集。在PCA降维后,使用测试集来证实相关DR的性能。为了构造抄袭文档集,我们使用了4种不同的抄袭模式编译了4个测试集,每个都包括78个文档,即3×26,其中3篇文档内容来自每个种类。第一个抄袭集中只有一小部分是从候选文档源中原封不动地拷贝的;第二个抄袭集基于第一个,它改变了抄袭部分的句子,这些微小的改变包括时态的改变、主动语句和被动语句的改变、少量单词等;第三个抄袭集则是在抄袭的基础上删除部分句子,这在抄袭中也是经常发生的;第四个抄袭集通过将抄袭部分分隔开,并重新组合到抄袭文本的不同部分,这种特征就是所谓的多样抄袭模式。其他的研究者可以从http://www.ee.cityu.edu.hk/~twschow/DataSetPD.rar下载整个数据。
6.2 相关文档检索
在测试数据集的局部信息的辅助下,我们首先评价了相关DR的性能。为了量化检索结果,我们使用了每个查询文档饿平均准确率(Precision)和查全率(Recall)值,定义如下:
在本小节,我们经验性地设置参数值, N1=500,NF=100,对于混合MLMS(MLMS-Hybrid),λ=0.35,而对于MLMH(不包括全局信息),λ=0 。上述参数的配置,在实验中具有较好的性能,我们还研究了这些参数对结果的影响(详见6.4节)。基于以上度量,我们比较了MLMS、MLMH和VSM、LSI,还有我们先前的一些工作(即SOM-tf+tcf)[3]。选择传统的VSM和LSI方法来作对比有助于研究文档局部信息对检索性能的提升。关于VSM和LSI的详细内容见应用文献[5,6]。我们使用数据的原始特征,并不使用任何缩减技术来研究了VSM,对于LSI,只使用tf特征在100维隐式语义的代表上执行。注:如果我们使用相同的特征权值化方案,LSI使用tf-idf特征和MLM-Global是一样的。
不同方法的检索结果全部集中于图Fig.2中,对应的数字对比结果列于表Table1中。 图Fig.2显示了检索的文档从1到360变化时,对于每个查询,数据集里最相似的候选文档检索结果精度。可以看到,MLM方法和LSI模型在精度结果上较优于VSM。一般来说,MLMH只考虑段落匹配的局部信息,当检索的文档数小于180时,比其他方法性能都要好。我们先前的工作-SOM也带来了满意的性能,因为它在文档相似度里直接包含了词关联的效果,同时为了提取明显的特征关联,需要扫描整个数据集。当检索的文档较少时,带有局部信息的方法(例如MLMH,MLMS-Local和MLMS-Hybrid)比不带局部信息方法表现较好的性能。同时我们也注意到当检索的文档数小于200时,MLM-Local比MLM-Global性能好。另一方面,由于集成了全局信息,当检索的文档数大于50时,MLM-Hybrid表现的性能比MLM-Local好。对比表Table1中的数据,我们观察到当10个候选文档被检索时,MLM方法在检索精度上比VSM提高了10个百分点,当检索文档增加到120时,它们仍然提高了4个百分点。同时,混合距离的MLMS比只有全局信息的MLMS提高了2个百分点。类似的查全率(Recall)结果也都列在表Table1中。总体来说,在关联中增加了段落信息比使用直方图或签名要好,这样确保了在接下来的PD中,源文档不会被误滤掉,因而减小了检测失败率。
…… 此处隐藏:1129字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [政务民生]2013年公共基础知识热点问题(七)
- [政务民生]检验检测机构资质认定评审准则及释义20
- [政务民生]关于印发重庆市房屋建筑和市政基础设施
- [政务民生]1、隧道洞身开挖支护施工技术交底书
- [政务民生]2015年山东省17地市中考语文试题分类汇
- [政务民生]2-高级会计师资格考试和评审流程图
- [政务民生]2018版中国清分机行业发展分析及前景策
- [政务民生]新课改高中政治探究
- [政务民生]2018-2024年中国新型组合房屋行业投资
- [政务民生]2015年上海市春季高考数学模拟试卷五
- [政务民生]灌砂法及环刀法测压实度(带计算过程)
- [政务民生]运筹学实验2求解非线性规划
- [政务民生]劝学、逍遥游默写(教师卷)
- [政务民生]《运筹学》 - 期末考试 - 试卷A - 答案
- [政务民生]八年级英语下册 Module 6 Hobbies测试
- [政务民生]2019年宪法知识竞赛试题库100题(含答
- [政务民生]自动化英文文献翻译
- [政务民生]公文格式实施细则
- [政务民生]高一地理上册课堂跟踪练习题6
- [政务民生]会计继续教育习题及答案
- 第三章 无约束最优化方法
- 泛读教程第三册答案
- 魏晋南北朝文学
- 幂的运算复习题
- 城市环境问题的成因与治理策略_以社会
- 钢结构行业产业链及竞争分析研究
- 新型热塑性弹性体增韧聚丙烯的研究
- 中国旅游地理B卷试题及答案
- (苏教版)五年级数学上册第三单元测试卷
- 不稳定性心绞痛诊断与治疗
- 俞氏国际后勤职能部门绩效考核办法
- GB7258-2017新标准考试题含答案
- 小学生汉字听写比赛活动方案
- 1.3《平抛运动》学案 教科版必修2
- 2011香港特别行政区公务员考试复习资料
- 考虑水力条件变化的城市给水管网可靠性
- 表面活性剂在油田开发和生产中的应用
- ITT内部培训资料-FI端吸泵的介绍
- 文明守纪,从我做起学生发言稿
- 初中读《聊斋志异》心得体会800字范文




