爬取CSDN博客保存成PDF的方法  

在线阅读下载全文

作  者:刘士 支浩 

机构地区:[1]中国电波传播研究所 [2]中国电子科技集团公司第五十二研究所

出  处:《电子世界》2018年第20期144-144,共1页Electronics World

摘  要:本文阐述了一种爬取指定CSDN账号的所有博文进行内容提并批量合并成PDF的方法,对该方法给出了Python语言的实现方式。实验结果证明,该方法具有可操作性和实用性。引言:在实际工作中常常需要对感兴趣的CSDN博文保存成电子书,从而可以达到多设备、无网络的情况下进行阅读。本文介绍了如何使用Chrome浏览器和Python语言将目标博客内容爬取后进行信息提取,然后合并成PDF格式的方法。除Python自带的标准库外,所用到的Python库为BeautifulSoup、pdfkit、PyPDF2。本文一个主要成果是对爬取到的网页进行有效的数据清洗和自定义,在博客篇数较多时进行快速合并。

关 键 词:PDF格式 CSDN PYTHON语言 博客 保存 可操作性 信息提取 数据清洗 

分 类 号:TP312[自动化与计算机技术—计算机软件与理论]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象