Skip to content

Latest commit

 

History

History
62 lines (54 loc) · 4.68 KB

File metadata and controls

62 lines (54 loc) · 4.68 KB

Ruby 网页抓取

此列表包含与网页抓取和数据处理相关的 ruby​​ 库

网络

  • httparty 让 http 再次变得有趣!
  • http 用于发出 HTTP 请求的简单 Ruby DSL
  • excon 适用于 Ruby 的可用、快速、简单的 HTTP(S) 1.1
  • nestful 带有健全 API 的简单 Ruby HTTP/REST 客户端
  • EM-HTTP-Request - 基于 EventMachine 的异步 HTTP 客户端
  • excon - 可用、快速、简单的 Ruby HTTP 1.1。它作为通用 HTTP(s) 客户端工作得很好,特别适合在 API 客户端中使用。
  • Faraday - 一个 HTTP 客户端库,在许多适配器(例如 Net::HTTP)上提供通用接口,并在处理请求时包含 Rack 中间件的概念/响应周期。
  • Http Client - 在 Ruby 中提供类似于 libwww-perl (LWP) 的功能。
  • HTTP - HTTP Gem:用于发出 HTTP 请求的简单 Ruby DSL。
  • Http-2 - HTTP/2 协议的纯 Ruby 实现
  • Patron - Patron 是一个基于 libcurl 的 Ruby HTTP 客户端库。
  • RESTClient - Ruby 的简单 HTTP 和 REST 客户端,灵感来自用于指定操作的微框架语法。
  • Savon - Savon 是 Ruby 编程语言的 SOAP 客户端。
  • Sawyer - HTTP 的秘密用户代理,建立在 Faraday 之上。
  • Spyke - 以类似 ActiveRecord 的方式与 REST 服务交互。
  • Typhoeus - Typhoeus 包装了 libcurl 以便发出快速可靠的请求。
  • Mechanize - Mechanize 是一个 ruby​​ 库,可以轻松实现自动化 Web 交互。

Web 抓取框架

  • upton - 一个包含电池的框架,用于轻松进行网络抓取
  • Wombat - 具有优雅 DSL 的 Web 抓取工具,可解析网页中的结构化数据。
  • Anemone - 网络蜘蛛框架,可以蜘蛛域并收集有关它访问的页面的有用信息
  • Spidr - 多功能 Ruby 网络爬虫库,可以爬取一个站点、多个域、某些链接或无限。 Spidr 旨在快速且易于使用。
  • kimuraframework - 用 Ruby 编写的现代网络抓取框架,可与 Headless Chromium/Firefox、PhantomJS 或简单的 HTTP 请求一起使用,并允许抓取并与 JavaScript 交互呈现的网站
  • arachnid2 一个简单、快速、无框架的爬虫,具有合理的默认值和许多选项。抓取页面并直接针对 Typhoeus 响应或 Watir 浏览器运行您的代码。

HTML/XML 解析

  • nokogiri - 支持 XPath 和 CSS 选择器的 HTML、XML、SAX 和 Reader 解析器
  • loofah - 基于 Nokogiri 的 HTML/XML 操作和清理
  • HappyMapper - 允许您解析 XML 数据并将其快速轻松地转换为 ruby​​ 数据结构。
  • HTML::Pipeline - HTML 处理过滤器和实用程序。
  • Oga - 用 Ruby 编写的 XML/HTML 解析器。 Oga 不需要 libxml 等系统库,在各种平台上安装更容易、更快捷。
  • Ox - 一个快速的 XML 解析器和对象编组器。
  • ROXML - 使用注解样式类方法在 Ruby 和 XML 之间自定义映射和双向编组,通过