为抓新闻热点 初涉人工智能
2020-08-17吴冲
大学生 2020年8期
吴冲
30分钟,37行代码,6000条数据

我在百度上搜索了“爬虫”,大量的爬虫实战案例就展现在我眼前。在认真阅读了多篇文章后,我发现大部分案例都用了python语言。因为python是一门开源语言,简单易用,很多技术或算法都是用python编写的,并且很多人也愿意将自己的工作成果分享到网上,其中有不少数据挖掘与数据分析领域的成果,所以利用python语言进行科研或工作,就像站在前人的肩膀上一样,工作效率会大幅度提高。于是第二天一大早,我就背着电脑直奔图书馆,准备花一天时间学习python,完成作业。
因为上过C语言的课程,我知道编程基本的逻辑跟我们思考问题和处理问题的思维方式是一样的。拿到python语言代码文件后,我发现它的行文逻辑跟C语言差不多,只有变量声明方式、函数写法等关键词、语言特性等基础知识略微不同。随后,我去网上找来一个python语言的基础教程,快速浏览基本的知识内容后,便开始模仿一个爬虫例子,试着编写我自己的爬虫命令。
按照爬虫案例的思路,我先引入HTTP请求库、数据处理库和Execl文件生成库,然后写了一个函数来获取网站数据,又写了一个函数来对获取来的数据进行数据整理,最后用一个执行函数来调用前面两个函数,并将处理整理后的数据写入新创建的Execl表格中,就可以完成快速获取数据的任务了。整个过程一共用了大概30分钟,代码仅37行。
完成代码的编写后,我在命令行中输入“python getdata.py”,程序就开始运行了。当看到爬虫分别从新闻网和微博等社交平台获取我需要的热点新闻,并且帮我整理好近3年来近6000条新闻数据,以Execl表格形式在我的目录文件夹中出现的时候,我非常开心和自豪。……
登录APP查看全文
