python怎么抓取网页中DIV的文字

Python0285

python怎么抓取网页中DIV的文字,第1张

1、编写爬虫思路:

确定下载目标,找到网页,找到网页中需要的内容。对数据进行处理。保存数据。

2、知识点说明:

1)确定网络中需要的信息,打开网页后使用F12打开开发者模式。

在Network中可以看到很多信息,我们在页面上看到的文字信息都保存在一个html文件中。点击文件后可以看到response,文字信息都包含在response中。

对于需要输入的信息,可以使用ctrl+f,进行搜索。查看信息前后包含哪些特定字段。

对于超链接的提取,可以使用最左边的箭头点击超链接,这时Elements会打开有该条超链接的信息,从中判断需要提取的信息。从下载小说来看,在目录页提取出小说的链接和章节名。

2)注意编码格式

输入字符集一定要设置成utf-8。页面大多为GBK字符集。不设置会乱码。

复制,粘贴,删除不用的部分,留下的就是文字部分

或者你懂word的宏命令,可以在word里用宏命令来做,比用python要简单一些。

第二种方面,直接用截屏软件把需要的文字截下来,然后用电脑或者手机端的OCR软件直接OCR下文字部分即可