Skip to content

Repository files navigation

一个功能还算强大的Python爬虫工具,由我趁着初中毕业的暑假无聊捣鼓而成,旨在应对较为复杂的网页抓取场景。

以下为已经完成的功能(在最新版)

​​全面伪装:​​ 随机UA、动态Referer、IP代理池轮换、Cloudscraper反Cloudflare、curl_cffi伪造TLS指纹,有效绕过反爬。

​​智能提取:​​ 结合AI算法(Readability)与启发式规则,精准抓取网页正文,自动过滤垃圾内容。

​​多模式抓取:​​ 支持静态抓取、动态渲染(需Selenium)、分布式Redis队列、Bloom Filter高效去重。

​​行为模拟:​​ 可模拟人类浏览行为(鼠标移动、滚动、随机点击),降低被识别风险。

​​资源下载:​​ 自动探测并下载图片资源(含CSS背景图、图标、),支持多线程高速下载与大小限制。

​​便捷管理:​​ 提供图形界面(GUI),包含日志查看、链接挖掘、文本/链接/图片列表保存、高级设置(配置文件保存/加载)等功能。

​​进程稳定:​​ 请求重试、连接超时、异常检测、编码自动识别,提升爬虫稳定性。

嗯,差不多就是这样,本人初见Python,不喜勿喷

About

一个功能还算强大的Python爬虫工具,由我趁着初中毕业的暑假无聊捣鼓而成,旨在应对较为复杂的网页抓取场景。

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages