此列表包含与网页抓取和数据处理相关的 ruby 库
- httparty 让 http 再次变得有趣!
- http 用于发出 HTTP 请求的简单 Ruby DSL
- excon 适用于 Ruby 的可用、快速、简单的 HTTP(S) 1.1
- nestful 带有健全 API 的简单 Ruby HTTP/REST 客户端
- EM-HTTP-Request - 基于 EventMachine 的异步 HTTP 客户端
- excon - 可用、快速、简单的 Ruby HTTP 1.1。它作为通用 HTTP(s) 客户端工作得很好,特别适合在 API 客户端中使用。
- Faraday - 一个 HTTP 客户端库,在许多适配器(例如 Net::HTTP)上提供通用接口,并在处理请求时包含 Rack 中间件的概念/响应周期。
- Http Client - 在 Ruby 中提供类似于 libwww-perl (LWP) 的功能。
- HTTP - HTTP Gem:用于发出 HTTP 请求的简单 Ruby DSL。
- Http-2 - HTTP/2 协议的纯 Ruby 实现
- Patron - Patron 是一个基于 libcurl 的 Ruby HTTP 客户端库。
- RESTClient - Ruby 的简单 HTTP 和 REST 客户端,灵感来自用于指定操作的微框架语法。
- Savon - Savon 是 Ruby 编程语言的 SOAP 客户端。
- Sawyer - HTTP 的秘密用户代理,建立在 Faraday 之上。
- Spyke - 以类似 ActiveRecord 的方式与 REST 服务交互。
- Typhoeus - Typhoeus 包装了 libcurl 以便发出快速可靠的请求。
- Mechanize - Mechanize 是一个 ruby 库,可以轻松实现自动化 Web 交互。
- upton - 一个包含电池的框架,用于轻松进行网络抓取
- Wombat - 具有优雅 DSL 的 Web 抓取工具,可解析网页中的结构化数据。
- Anemone - 网络蜘蛛框架,可以蜘蛛域并收集有关它访问的页面的有用信息
- Spidr - 多功能 Ruby 网络爬虫库,可以爬取一个站点、多个域、某些链接或无限。 Spidr 旨在快速且易于使用。
- kimuraframework - 用 Ruby 编写的现代网络抓取框架,可与 Headless Chromium/Firefox、PhantomJS 或简单的 HTTP 请求一起使用,并允许抓取并与 JavaScript 交互呈现的网站
- arachnid2 一个简单、快速、无框架的爬虫,具有合理的默认值和许多选项。抓取页面并直接针对 Typhoeus 响应或 Watir 浏览器运行您的代码。
- nokogiri - 支持 XPath 和 CSS 选择器的 HTML、XML、SAX 和 Reader 解析器
- loofah - 基于 Nokogiri 的 HTML/XML 操作和清理
- HappyMapper - 允许您解析 XML 数据并将其快速轻松地转换为 ruby 数据结构。
- HTML::Pipeline - HTML 处理过滤器和实用程序。
- Oga - 用 Ruby 编写的 XML/HTML 解析器。 Oga 不需要 libxml 等系统库,在各种平台上安装更容易、更快捷。
- Ox - 一个快速的 XML 解析器和对象编组器。
- ROXML - 使用注解样式类方法在 Ruby 和 XML 之间自定义映射和双向编组,通过