APP下载

数据到文本生成研究综述

2019-01-21龚隽鹏张鹏洲

计算机技术与发展 2019年1期
关键词:规则文本内容

曹 娟,龚隽鹏,张鹏洲

(1.中国传媒大学 新媒体研究院,北京 100024;2.中国传媒大学 理工学部,北京 100024)

0 引 言

自从腾讯2015年推出Dream writer,机器新闻写作开始受到国内研究者的关注,并迅速成为学界和业界研究的热点。机器新闻写作是指基于数据统计和机器学习,运用算法,从可识别的数据中提取具有新闻价值的信息,形成新闻报道角度,自动选择语词样本、新闻报道模板生成新闻故事[1]。国外的研究者称机器新闻为机器人新闻(robot journalism)或自动化新闻(automated journalism)。目前国外已经投入市场的产品包括美国Automated Insights公司的Wordsmith和Narrative Science公司的Quill,国内企业也做了一系列探索和尝试,包括腾讯公司的Dream writer、新华社的快笔小新、今日头条的Xiaoming bot、第一财经的DT稿王、南方都市报的“小南”和广州日报的“阿同”[2]。当前适合通过机器或算法进行的新闻写作,一般是以各种数据、图表的引用和分析为基础的硬新闻,具有明显的数据处理色彩,主要用于财经、体育、气象地质和健康等领域[3]。

机器新闻写作的核心在于自然语言生成(natural language generation,NLG)技术。自然语言生成中一个典型技术就是使用恰当而流畅的文本来描述结构化的数据,即数据到文本生成(data-to-text generation;data-to-document generation)。数据到文本生成可以归结为两大任务:说什么(what to say)和怎么说(how to say it)。说什么是从输入的数据中选择合适的子集用于表达,也叫做内容选择(content selection);怎么说就是用自然语言描述这个子集,也叫做表层实现(surface realization)[4]。文中对近年来数据到文本生成的发展脉络和研究方法进行梳理,对已有数据集和评价方法进行总结,分析当前存在的问题并探讨其未来发展方向。……

登录APP查看全文

猜你喜欢

规则文本内容
内容回顾温故知新
撑竿跳规则的制定
数独的规则和演变
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
让规则不规则
TPP反腐败规则对我国的启示
主要内容
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本