Python实现的爬取小说爬虫功能示例

(编辑：jimmy 日期: 2024/5/9 浏览：3 次 )

本文实例讲述了Python实现的爬取小说爬虫功能。分享给大家供大家参考，具体如下：

想把顶点小说网上的一篇持续更新的小说下下来，就写了一个简单的爬虫，可以爬取爬取各个章节的内容，保存到txt文档中，支持持续更新保存。需要配置一些信息，设置文档保存路径，书名等。写着玩，可能不大规范。

# coding=utf-8
import requests
from lxml import etree
from urllib.parse import urljoin
import re
import os
# 获取页面，并返回解析整理好的文本
def get_page(url):
  response = requests.get(url, headers=header)
  set_encoding(response)
  text = parse_page(response.text)
  return text
# 解析页面，将当前页面中的文字筛选出来
def parse_page(html):
  title = re.findall('<div class="bookname">\s+<h1>(.+"content">(.*"_blank" href="//www.jb51.net/Special/648.htm">Python Socket编程技巧总结》、《Python正则表达式用法总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》
希望本文所述对大家Python程序设计有所帮助。

上一篇：Django中使用Whoosh进行全文检索的方法
下一篇：Python文件打开方式实例详解【a、a+、r+、w+区别】