数据到文本生成研究综述
2019-01-21龚隽鹏张鹏洲
曹 娟,龚隽鹏,张鹏洲
(1.中国传媒大学 新媒体研究院,北京 100024;2.中国传媒大学 理工学部,北京 100024)
0 引 言
自从腾讯2015年推出Dream writer,机器新闻写作开始受到国内研究者的关注,并迅速成为学界和业界研究的热点。机器新闻写作是指基于数据统计和机器学习,运用算法,从可识别的数据中提取具有新闻价值的信息,形成新闻报道角度,自动选择语词样本、新闻报道模板生成新闻故事[1]。国外的研究者称机器新闻为机器人新闻(robot journalism)或自动化新闻(automated journalism)。目前国外已经投入市场的产品包括美国Automated Insights公司的Wordsmith和Narrative Science公司的Quill,国内企业也做了一系列探索和尝试,包括腾讯公司的Dream writer、新华社的快笔小新、今日头条的Xiaoming bot、第一财经的DT稿王、南方都市报的“小南”和广州日报的“阿同”[2]。当前适合通过机器或算法进行的新闻写作,一般是以各种数据、图表的引用和分析为基础的硬新闻,具有明显的数据处理色彩,主要用于财经、体育、气象地质和健康等领域[3]。
机器新闻写作的核心在于自然语言生成(natural language generation,NLG)技术。自然语言生成中一个典型技术就是使用恰当而流畅的文本来描述结构化的数据,即数据到文本生成(data-to-text generation;data-to-document generation)。数据到文本生成可以归结为两大任务:说什么(what to say)和怎么说(how to say it)。说什么是从输入的数据中选择合适的子集用于表达,也叫做内容选择(content selection);怎么说就是用自然语言描述这个子集,也叫做表层实现(surface realization)[4]。文中对近年来数据到文本生成的发展脉络和研究方法进行梳理,对已有数据集和评价方法进行总结,分析当前存在的问题并探讨其未来发展方向。……
