教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 精品文档 > 政务民生 >

一种高效防抄袭的由粗到细的框架(4)

来源:网络收集 时间:2026-07-21
导读: 6.3 抄袭检测 本节研究了我们所提出的方法在在PD上的性能。我们使用和上一节相同的设置。(见6.2节),另外三个参数设置如下:N2=20000,τ=0.5,Nret=500。我们首先对输入的抄袭文档作为查询使用不同的检索方法(即

6.3 抄袭检测

本节研究了我们所提出的方法在在PD上的性能。我们使用和上一节相同的设置。(见6.2节),另外三个参数设置如下:N2=20000,τ=0.5,Nret=500。我们首先对输入的抄袭文档作为查询使用不同的检索方法(即MLMH,MLMS-Global,MLMS-Local和MLMS-Hybrid)检索500个文档(即Nret=500)。然后我们观察源文档在检索结果中的等级,较高的等级比较容易检测,然后我们使用基于分级的PD算法(即进一步的句子处理)对候选文档重新分级。

表Table2显示的是78个第一类抄袭文档作为查询得到的源文档检索结果的平均等级统5

计数据。表Table1也包括了检测失败率,表示了检索的文档所占的比例,源文档不包括在内。另一个指标是混合等级6通过平均等级和检测失败率计算出。这里缩放参数ε=0.1,它的选择基于图Fig.3 。很明显,在所有的评价标准中,使用PD算法给分级带来了显著的性能提升。MLMS-Local显示出比MLMS-Hybrid更好的性能。很明显,包含全局信息给距离联合函数带来了噪声。因为抄袭者为了逃避PD系统,倾向于从源文档中拷贝或修改少量段落。MLMS-Local也比MLMH表现的性能好,这要归于权值{wk}带来了所选特征和段落长度信息量。MLMH只比MLMS-Global所表现的性能稍好一点。此外,MLMS-Global在检测失败率上表现的效果最差,表明很多源文档没有出现在检索的列表中。对于第一类抄袭集,我们也对比了PD算法和多层自组织映射方法(MLSOM)[2]。不出意外,我们的方法仍然带来了较优的结果,因为MLSOM只考虑到段落级别。在执行PD时,我们研究了从最终检索结果中首批出现的Nret个源文档,对第一类抄袭集,图Fig.4(a)绘制出了在等级列表中源文档存在的数量和检索的文档数的关系,很显然,PD算法领先于其它检索方法。当只有一篇文档被检索到时,它获得了大约55%的源文档。MLMS-Local显著地超过了MLMS-Global。此外,当检索的文档数量大于150,MLMH显示出了比MLMS-Global遥遥 ──────── 5

In Tables 2 and 4, AR denotes Average Rank, SD denotes Standard Deviation,MaxR denotes Maximum Rank, MinR denotes Minimum Rank, FDR denotes Failed Detection Ratio, and CR denotes Composite Rank.

6

Composite Rank = Average Rank/(1-Failed Detection Ratio).

领先的性能。为了研究缩放参数ε对PD检测结果的影响,当ε从0.0到1.0以0.1的步长增加时,我们总结了Average Rank的值。它表明有一个最优的值,而不需要试探了。ε=0.1显示出对于第一类抄袭集它是最优的选择。然后,我们考虑自动的PD而不检查等级列表(见5.2节)里可能的源文档。我们设置了不同的阈值θ用以执行二值判断。图Fig.5(a)显示了不同的阈值θ下自动PD结果。它包括了Source Detection7和False Detection,False Detection表示非抄袭源被检测为抄袭源,很明显,较高的阈值带来了不可预料的错误检测。随着阈值θ的增加,Source Detection开始下降,同时False Detection刚开始有明显的下降趋势,然后又开始上升。自动PD的一个最优选择就是找到一个θ,使得Source Detection越高越好,同时保持较低的False Detection。将θ值保持在0.1附近可以带来平衡的性能。在第二类抄袭集上使用基于分等级的PD的结果总结在图Fig.4(b)和表Table3中,结果和第一类很相似,因为第二类集合是从第一类中改变部分句子的来的,阈值θ除了0.05附近,不同的阈值对实验的效果也很类似(见图Fig.5(b))。和前两类抄袭集相比,在第三类上PD变得就有些困难了,因为拷贝的文本中故意地删除了一些句子。表Table4和图Fig.4(c)也证实了检测的困难。通过检索方法或PD算法,平均等级要高一点。 从图Fig.3中可以看出,缩放参数ε在增加时它的最优值在0.4左右,并存在一个局部最优值0.2。此外,在自动PD重,从图Fig.5(c)可以看出,最优的缩放参数ε下降到0.01左右。 随着阈值θ的增加,Source Detection急剧下降,PD的最大困难是检测多重抄袭的文本,它需要将源文档分割成不同的拷贝,第四类抄袭集展示了这种情况,表Table5和图Fig.4(d)显示了我们所提出的方法带来较好的结果。从图Fig.3中可以看出,缩放参数ε在取0.9是达到最优,同时在0.3和0.5之间有较多的局部最优值。对于不同阈值θ的自动PD算法得到的实验结果见图Fig.5(d)中的曲线。阈值θ的平衡点低于0.01。当阈值θ增加到0.2时,PD系统对源的检测会失败。

总体来说,MLMS-Local一直领先于其他检索方法。我们的PD算法在分级统计上性能有显著的提升,于是,用户可以轻易的鉴别出抄袭源。对于不同的抄袭模式,单一的抄袭模式(如第一类和第二类抄袭集)检测只需要较小的缩放参数ε,带来了很大的计算时效性;对多抄袭模式的检测需要增大缩放参数ε,让抄袭的文本不能躲过PD系统,但也增加了计算时间的开销,因此在经验性地设置缩放参数上也要依赖于抄袭模式。另一方面,阈值θ的最优值也依赖于不同的抄袭模式。根据我们的观察,检测多重抄袭模式通常需要较小的阈值,而对于单一的抄袭模式则需要较大的阈值。

────────

7

Source Detection=1 - Failed Detection Ratio.

…… 此处隐藏:693字,全部文档内容请下载后查看。喜欢就下载吧 ……
一种高效防抄袭的由粗到细的框架(4).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wendang/447858.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)