一个功能还算强大的Python爬虫工具,由我趁着初中毕业的暑假无聊捣鼓而成,旨在应对较为复杂的网页抓取场景。
以下为已经完成的功能(在最新版)
全面伪装: 随机UA、动态Referer、IP代理池轮换、Cloudscraper反Cloudflare、curl_cffi伪造TLS指纹,有效绕过反爬。
智能提取: 结合AI算法(Readability)与启发式规则,精准抓取网页正文,自动过滤垃圾内容。
多模式抓取: 支持静态抓取、动态渲染(需Selenium)、分布式Redis队列、Bloom Filter高效去重。
行为模拟: 可模拟人类浏览行为(鼠标移动、滚动、随机点击),降低被识别风险。
资源下载: 自动探测并下载图片资源(含CSS背景图、图标、),支持多线程高速下载与大小限制。
便捷管理: 提供图形界面(GUI),包含日志查看、链接挖掘、文本/链接/图片列表保存、高级设置(配置文件保存/加载)等功能。
进程稳定: 请求重试、连接超时、异常检测、编码自动识别,提升爬虫稳定性。
嗯,差不多就是这样,本人初见Python,不喜勿喷