基于耦合度和PDG混合特征的源代码作者归属预测
2021-08-06冯秀芳陈永乐
计算机工程与科学 2021年7期
陈 杰,冯秀芳,陈永乐
(太原理工大学信息与计算机学院,山西 晋中 030600)
1 引言
软件作者识别有助于在案件中对真实的作者和版权的争议进行裁决。代码作者署名在文本分析、软件著作权调查[1]、软件剽窃检测[2]等方面有广泛的应用。学术著作中作者身份归属预测的任务通常是出于计算机安全需求的驱动,它通过分析残留的恶意代码[3]识别恶意软件程序[4]的作者。源代码作者身份归属预测主要通过提取某一作者的编码结构特征,根据这些结构特征分析源代码是否由这一作者所编写。此外,对于那些希望保持匿名的程序员来说,这是一个严重的隐私风险。
软件取证可以使用编码样式识别源代码的特定作者,研究界也越来越关注通过编程风格[5]识别作者的方式。代码作者身份识别在学术界可以对学生编程作业进行剽窃检测,在商业领域可以对软件著作和专利侵权进行分析。因此,代码作者归属预测在学术界和商业界具有重要的现实意义。本文针对源代码的特征属性展开研究,提出一种源代码的作者归属模型。

Figure 1 Framework of source code author identification 图1 源代码作者判别框架图
为了对代码样本[6]进行作者身份识别,已有的大多数代码作者身份识别工作都采用统计分析技术或基于相似性度量的排序方法。特别是Krsul等人[7]率先探索了通过检查手工制作的编程风格特征来识别程序作者的可能性,他们采用了一种称为多元判别分析的统计分析技术来对29名程序员的代码样本进行分类。……
登录APP查看全文
