教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 精品文档 > 政务民生 >

一种高效防抄袭的由粗到细的框架(3)

来源:网络收集 时间:2026-07-21
导读: 其中,ε(ε∈[0,1])是缩放参数,增大ε值将导致遍历更多的段落,并消耗更多的计算时间。根据我们的经验研究(见6.3节),使用较小的ε值在检测单个抄袭段落时更合适,同时大的ε值适合检测抄袭多个段落的文章。 因

其中,ε(ε∈[0,1])是缩放参数,增大ε值将导致遍历更多的段落,并消耗更多的计算时间。根据我们的经验研究(见6.3节),使用较小的ε值在检测单个抄袭段落时更合适,同时大的ε值适合检测抄袭多个段落的文章。

因为在句子级别我们使用大词汇表V2(见3.2节和3.3节)中词(指示对应词条的出现)

Sen

的索引数来作为每个句子节点的签名S。在我们的应用中,将不考虑元素数量小于3的签名。然后定义两个句子k和l的重叠率,句子k在查询文档中,l在候选文档中。

设置另外一个前提τ(τ∈[0.5,1])来控制哪个句子将被认为是抄袭的部分,并进行融合距离处理。查询文档Dq和候选文档Dc(Dc∈Φ)之间的总体抄袭距离定义如下:

其中,Nq和Nc分别表示查询文档和候选文档的段落数,Nq,iSen和Nc,jSen分别表示第i个段落Pi(Pi∈Dq)和第j个段落Pj(Pj∈Dc)的句子数,并预定义一个很大的值κ表示距离函数找不到匹配。Algorithm 1.给出完整的基于等级的PD算法。

q

q

c

c

5.2 自动检测抄袭

自动的PD指设定一个阈值θ在源文档上做二值判断。如果所查询的文档的确是抄袭的,则它与源文档之间的相似度一般要比它和其他文章之间的相似度大。因此用户可以设置一个合适的阈值将源文档标出,并自动地找到源文档。除了基于等级的PD需要返回源文档列表外,自动的PD和基于等级的PD在步骤上基本一样。此外,我们使用下面的公式(27)来代替公式(26),因为我们使用相似度作为度量而非不相似度。

如果相似度比阈值大,则此文档就被认为是抄袭源,通过这种方法,用户将可以节省进一步检查等级列表。

实际上,就计算复杂度而言,提供一个全面的分析表达式不合适的,因为它依赖于实际的文档数据和我们使用的参数,例如,文档的尺寸越大,系统花费在比较查询文档和候选文档上的时间就越多;另一方面,缩放参数ε也影响查询的响应时间,增大ε,例如ε=1,显然会导致更多的段落比较计算。增大距离前提,将导致给距离融合带来产生更多的噪声,对检测性能下降。根据我们的实验,通常ε取小于0.5效果会足够的好。对于计算开销的花费,我们也进行了定性的研究(见6.5节)。

6. 实验

在这一部分,我们执行了详细的实验来作为我们所提出的PD方法的有效验证。这部分包括数据集描述(详见6.1节)、相关DR的性能(详见6.2节)、PD的性能(详见6.3节),参数影响的研究(详见6.4节)和计算时间的定性研究(详见6.5节)。

6.1 数据集和实验环境搭建

我们执行了大规模的实验来显示我们所提出的PD方法的性能。我们已经收集了一个文档数据集“Html_CityU1”,它包含26个种类[2-4]。每个类别包括400篇文档,总共加一起有10400篇文档。为了提供一个更真实的测试平台,我们建立的数据集中所包含的文档大小从几百个词到两万个词不等。对于每个类别的400篇文档,都是使用一组关键字从Google中检索得到的,一些关键字在不同的类别中有所重复,但是不同类别的关键字是不一样的,实验的执行是由两部分组成的,第一部分是在相关文档的DR上评价检索的性能,第二部分是执行PD。数据集首先分成一个候选集和一个测试集,用来作为查询使用。从26个类别中随机地选择出1040个测试文档,即26×40。余下的9360个文档用来作为候选集。在PCA降维后,使用测试集来证实相关DR的性能。为了构造抄袭文档集,我们使用了4种不同的抄袭模式编译了4个测试集,每个都包括78个文档,即3×26,其中3篇文档内容来自每个种类。第一个抄袭集中只有一小部分是从候选文档源中原封不动地拷贝的;第二个抄袭集基于第一个,它改变了抄袭部分的句子,这些微小的改变包括时态的改变、主动语句和被动语句的改变、少量单词等;第三个抄袭集则是在抄袭的基础上删除部分句子,这在抄袭中也是经常发生的;第四个抄袭集通过将抄袭部分分隔开,并重新组合到抄袭文本的不同部分,这种特征就是所谓的多样抄袭模式。其他的研究者可以从http://www.ee.cityu.edu.hk/~twschow/DataSetPD.rar下载整个数据。

6.2 相关文档检索

在测试数据集的局部信息的辅助下,我们首先评价了相关DR的性能。为了量化检索结果,我们使用了每个查询文档饿平均准确率(Precision)和查全率(Recall)值,定义如下:

在本小节,我们经验性地设置参数值, N1=500,NF=100,对于混合MLMS(MLMS-Hybrid),λ=0.35,而对于MLMH(不包括全局信息),λ=0 。上述参数的配置,在实验中具有较好的性能,我们还研究了这些参数对结果的影响(详见6.4节)。基于以上度量,我们比较了MLMS、MLMH和VSM、LSI,还有我们先前的一些工作(即SOM-tf+tcf)[3]。选择传统的VSM和LSI方法来作对比有助于研究文档局部信息对检索性能的提升。关于VSM和LSI的详细内容见应用文献[5,6]。我们使用数据的原始特征,并不使用任何缩减技术来研究了VSM,对于LSI,只使用tf特征在100维隐式语义的代表上执行。注:如果我们使用相同的特征权值化方案,LSI使用tf-idf特征和MLM-Global是一样的。

不同方法的检索结果全部集中于图Fig.2中,对应的数字对比结果列于表Table1中。 图Fig.2显示了检索的文档从1到360变化时,对于每个查询,数据集里最相似的候选文档检索结果精度。可以看到,MLM方法和LSI模型在精度结果上较优于VSM。一般来说,MLMH只考虑段落匹配的局部信息,当检索的文档数小于180时,比其他方法性能都要好。我们先前的工作-SOM也带来了满意的性能,因为它在文档相似度里直接包含了词关联的效果,同时为了提取明显的特征关联,需要扫描整个数据集。当检索的文档较少时,带有局部信息的方法(例如MLMH,MLMS-Local和MLMS-Hybrid)比不带局部信息方法表现较好的性能。同时我们也注意到当检索的文档数小于200时,MLM-Local比MLM-Global性能好。另一方面,由于集成了全局信息,当检索的文档数大于50时,MLM-Hybrid表现的性能比MLM-Local好。对比表Table1中的数据,我们观察到当10个候选文档被检索时,MLM方法在检索精度上比VSM提高了10个百分点,当检索文档增加到120时,它们仍然提高了4个百分点。同时,混合距离的MLMS比只有全局信息的MLMS提高了2个百分点。类似的查全率(Recall)结果也都列在表Table1中。总体来说,在关联中增加了段落信息比使用直方图或签名要好,这样确保了在接下来的PD中,源文档不会被误滤掉,因而减小了检测失败率。

…… 此处隐藏:1129字,全部文档内容请下载后查看。喜欢就下载吧 ……
一种高效防抄袭的由粗到细的框架(3).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wendang/447858.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)