教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 精品文档 > 政务民生 >

一种高效防抄袭的由粗到细的框架

来源:网络收集 时间:2026-07-21
导读: A coarse-to-?ne framework to efficiently thwart plagiarism 一种高效防抄袭的由粗到细的框架 Haijun Zhang, Tommy W.S. Chow n Department of Electronic Engineering, City University of Hong Kong, 83 Tat Chee Avenue, Kowloon, Hong Kong Pattern Re

A coarse-to-?ne framework to efficiently thwart plagiarism

一种高效防抄袭的由粗到细的框架

Haijun Zhang, Tommy W.S. Chow n

Department of Electronic Engineering, City University of Hong Kong, 83 Tat Chee Avenue, Kowloon, Hong Kong

Pattern Recognition 44 (2011) 471–487

摘要 本文呈现了一个使用多级匹配方法的语义框架用以防止抄袭(plagiarism detection PD)。多级结构,即使用“文档—段落—句子”的结构来描述一个文档。在文档和段落级,我们使用传统的降维技术将高维直方图映射到潜在的语义空间。使用EMD(Earth Mover’s Distance)来代替完全匹配方法来检索相关文档可以显著地缩小搜索范围。设计了两个抄袭检测算法,并将其用于有效的标出可疑的抄袭文档源。我们执行了大量的实验性验证包括文档检索、抄袭检测、有效参数和实验性系统响应的研究,结果证实了我们所提出的方法在执行抄袭检测上所具有的精确性和计算有效性。

Keywords: Document retrieval, Plagiarism detection, EMD, Multilevel matching 关键字: 文档检索 抄袭检测 EMD 多级匹配

1. 介绍

从餐馆预约到技术研究,因特网已经毋容置疑地成为了我们生活中不可缺少的一部分。网络在线的流行却向文本知识产权提出一个严峻的挑战,因为因特网和计算机技术能轻易地将知识信息传遍整个世界。人们可以轻松地搜索、复制、下载和重用在线资源。最令人感到罪恶昭彰的抄袭行为就是从其他的文章资源不加以任何修改地复制过来。但是这种类型的抄袭是很容易用抄袭检测系统(PD)鉴别出来的。稍不明显的例子是抄袭者将比人的文章嵌入到他们的文中,他们企图通过对已有的文章作词或句子的替换或从外源粘贴一些词语以躲开抄袭检测系统。剪切-粘贴型抄袭检测现在在教育系统里已经受到了持续的关注。高效率的抄袭检测系统现在面临的一个难题就是对源搜索的迅速查询响应,因为抄袭者可以抄袭因特网上的文档有数百万个,而每篇文档通常包含的词也有数千个。

现有的反抄袭技术包括指纹识别——专为合作抄袭而开发的技术,ranking技术——为文档检索而开发。 Hoad和Zobel[1]研究了这些技术并证明了ranking方法比指纹识别方法更优。Chow et al.[2] 通过使用ranking技术也得到了不错的结果。沿着这条线索,文本将呈现使用多级匹配的(multilevel matching MLM)由粗到细框架的抄袭检测技术,所提出的方法具有一些给力的特点包括通用性、健壮性和高效性。这些特点具体描述如下:

? 通用性是指文档的多级表示和它的编码特性。我们使用文档-段落-句子的结构来形成文

档的由粗到细的表示。在文档和段落级别,使用传统的降维工具——主成分分析(principal component analysis PCA)来获取潜在的语义主题,除了PCA,任何其它的潜在语义分析和降维技术都可以并入这个方案。 ? 由于使用签名匹配,所提出的系统是健壮的。通过牵涉特征每部分的长度和词条的直方

图来构造文档和段落级别的签名。句子的特征化是通过使用每个特征的索引数,这些特征对应于词汇表里对应的词。在签名编码中,我们不考虑特征在句子里的顺序,因

为抄袭致力于替换每个句子里的词或重组每个句子的结构来躲过PD系统。

? 文档的建模及应用显著地集中于计算,因为它们至少包含数千个词。我们提出的系统基

于深度匹配,使用由粗到细的策略来过滤不必要的搜索域。这种剪枝能力给我们带来

计算高效性。因此我们所提出的方法适用于大数据集和实际的在线应用。

本文的主要研究成果有三点。首先,我们提出了文档的多级表示和编码特征;第二,对于相关文档的检索,我们深入研究了MLM方法,即基于直方图的MLM(MLMH)和基于签名的MLM(MLMS);第三,实现了两个检测算法,通过设置合适的条件,在多级匹配之前就可以减掉期望不大的路径。

本文下面的章节安排如下:第二部分对文档建模及其应用作简要的综述,同时分别对PD、文档分类(Document Categorization)和文档识别(DR Document Recognition)的关系作出讨论;第三部分介绍多级文档的表示、文档分割、降维和特征编码,文档的分割使用HTML标签;我们在第四部分讨论基于直方图和签名的不同文档检索方法,而在第五部分,我们则实现了两种检测算法;接着,在第六部分描述了我们所执行的大量实验性验证;第七部分,基于观察的结果,列出从实际角度对系统框架提出建议;第八部分给出最终结论和下一步工作的提议,并结束本文。

2. 相关研究

这部分简要地综述了先前的工作,因为部分地包含了Tommy et al.[2]和我们最近的工作[3,4],也涉及到文档建模及其应用(即分类、检索和抄袭检测)。我们也讨论了PD和其他应用的关系。

2.1 文档建模

最早的文档建模方法是向量空间模型(vector space model VSM)[5],通常使用tf-idf方法来权值化特征。首先为特征描述构造一个基本词汇表,“tf”指特征的出现频次,而“idf”(inverse document frequency)指的是一个特征在多少篇文档中出现过。使用tf和idf来为每篇文档构造一个权值化的向量。两个文档之间的相似度可以使用余弦距离或任何其他的距离函数来度量。VSM将每篇文档特征向量的随意性长度减小到一个固定的值,但是描述一篇文档特征信息的频率也需要一定长度的向量,因为其中包含的词汇数量一般也是巨大的,这也明显地造成了计算上负担的增加,因此VSM在大文集上的应用不可行。此外,VSM对文档的统计属性不给力,因为它使用文档的低级特征,即词频。为了克服这些缺点,研究者已经提出数个降维方法,使用低维隐式表示方法来获取文档语义。隐式语义标定系数(LSI latent semantic indexing)[6],扩展的VSM,将文档和特征映射到隐式空间表示,它通过执行线性映射、单值分解(Singular Value Decomposition)将VSM模型的特征向量维度压低 。一个前进一步的概率模型是概率隐式语义标定系数(Probabilistic Latent Semantic Indexing)[7],为数据定义合适的一般模型,从混合分布里为每篇文档的词建模作为样本,并为混合部分形成因素表示。简单的介绍下其他的概率模型,如隐式Dirichlet分配(latent Dirichlet allocation - LDA)[8]、EFH(exponential family harmounium)[9]和泊松配合率(RAP – Rate Adapting Poisson)模型可以供参考。然而以上模型只基于“词袋”假设,因此一些有用的语义就可能会丢失掉,因为两篇含有相似特征频率的文档可能在行文上具有较大差别。在我们最近的工作中[3],为了在文档表示中包含更多语义,通过使用不同图表,我们提出了一个使用多特征的新的文档表示方法。应用不同的特征提取方法从每篇文档中提取特征频率(TF)和特征连接频率,然后通过共同地产生多特征,我们开发出一个Dual Wing Harmonium(DWH)模型来产生文档的隐式表示。

2.2 应用

在大量的文献资料上的文档应用主要包括文档识别(DR)、文档分类(DC)、文档抄袭检测(PD)。

DR是指给定一个查询,找出相似的文档,这个查询的范围可以从全文描述到文档的一些关键词。大部分广泛应用的检索技术都是基于关键词的的搜索方法,如Google,没有经过训练的用户只需要提供一些关键词给搜索引擎,就会得到相关文档的一个列表。另外一种DR使用文档查询,将整个文档作为查询输入以提高检索精度,但是它在计算量上比基于关键字的查询 …… 此处隐藏:6596字,全部文档内容请下载后查看。喜欢就下载吧 ……

一种高效防抄袭的由粗到细的框架.doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wendang/447858.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)