检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]中国电波传播研究所 [2]中国电子科技集团公司第五十二研究所
出 处:《电子世界》2018年第20期144-144,共1页Electronics World
摘 要:本文阐述了一种爬取指定CSDN账号的所有博文进行内容提并批量合并成PDF的方法,对该方法给出了Python语言的实现方式。实验结果证明,该方法具有可操作性和实用性。引言:在实际工作中常常需要对感兴趣的CSDN博文保存成电子书,从而可以达到多设备、无网络的情况下进行阅读。本文介绍了如何使用Chrome浏览器和Python语言将目标博客内容爬取后进行信息提取,然后合并成PDF格式的方法。除Python自带的标准库外,所用到的Python库为BeautifulSoup、pdfkit、PyPDF2。本文一个主要成果是对爬取到的网页进行有效的数据清洗和自定义,在博客篇数较多时进行快速合并。
关 键 词:PDF格式 CSDN PYTHON语言 博客 保存 可操作性 信息提取 数据清洗
分 类 号:TP312[自动化与计算机技术—计算机软件与理论]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.7